{"as_of":"2026-08-08T08:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b008a591c5fd2ec8a0cdddc45f2e6e5fb87f93f165d6bcbf5f9f18d665deb9b","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:36:01.072056Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05445/citation-record","integrity":"/paper/2506.05445/integrity","json":"/paper/2506.05445/citation-record.json","paper":"/paper/2506.05445"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.259507Z","title":null,"venue":null,"work_id":"1e3d5019-0549-45c7-923a-ebb4d5a73fe2","year":2015},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.605339Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:31fd3f918954a28e8c4fcd38934eb934a363d9dc5c2222ab57dbc3b7ec17abab","observation_id":"9d48139d-8836-41e3-ae6b-2f8ff8f667bd","resolution":{"observed_at":"2026-08-07T10:36:05.279110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.208949Z","title":"and Pearl, J","venue":null,"work_id":"0301ad4f-ba7a-4335-aa93-984619a880cb","year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.665123Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1a26da3a777fb6fc3282719de40ad35af87bdb0528756db6d98647dfe2e65844","observation_id":"ebfad1ab-7e77-4f31-908c-554a0d59c0ca","resolution":{"observed_at":"2026-08-07T10:36:05.227641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T10:35:56.756738Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.756738Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:d8abb1bd0e033ed5403a48366c92251df436fb3d40b118fd0fa1fdd70e2de045","observation_id":"d45b2319-f964-4499-bb6c-e92a8eae836f","resolution":{"observed_at":"2026-08-07T10:35:56.756738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.154738Z","title":null,"venue":null,"work_id":"a5afa958-6619-430f-b514-91c3c082f6ab","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.823275Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:9552d0b15a849b93525cd014deba8d54e0eafc7ecd48eeb6e31f982fb8a3fe99","observation_id":"c9389d4d-dee5-477b-bc34-d3fbf3a36cdc","resolution":{"observed_at":"2026-08-07T10:36:05.172607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.101399Z","title":"and Bareinboim, E","venue":null,"work_id":"7b1bfc5b-cd64-4c8e-86d8-f27e09855dac","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.896354Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:6edc7376e84a4e12a7ba2de09a9de2bc183f2fef7ebd6e381f593e88aec5878f","observation_id":"269ca6ea-c4e5-459a-b44b-bdd72d06a58d","resolution":{"observed_at":"2026-08-07T10:36:05.126760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:05.038800Z","title":null,"venue":null,"work_id":"4649b558-407b-4603-8313-ce7cd7df42db","year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:56.970646Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:d5221982d63864aa5d8ea37d140a9cb148f56bf2a93748d287b18be69f4a1146","observation_id":"0246fd85-67da-4d61-be80-6ef066d20f43","resolution":{"observed_at":"2026-08-07T10:36:05.066815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.984355Z","title":null,"venue":null,"work_id":"bc248614-6491-4436-8cab-b845763f140c","year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.045401Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1bf866b5a07dfc8ceb328a83980d8d9dc0e773f5ae2dbd9be64b1de6155ae94b","observation_id":"54e0fd50-c7ff-48b2-92bc-d12fdeea3cd7","resolution":{"observed_at":"2026-08-07T10:36:05.004765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.918805Z","title":null,"venue":null,"work_id":"ec256e15-286f-424b-bace-8647df735e62","year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.100420Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:7aa5f8c67f8051e287ce43c4609f39984fec5e1e03aa01fbfeed061f82d541f2","observation_id":"bcaa6341-0c28-4e2d-b9e9-124faad92207","resolution":{"observed_at":"2026-08-07T10:36:04.944649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.835993Z","title":null,"venue":null,"work_id":"f0dafa0b-c718-48a3-89eb-0f162f5ef587","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.151008Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:793a9ac9ceaddea2a9dd07ea55397901164af0d29a8e9e9b2da63530d943db53","observation_id":"0db23e0e-4f18-4ba0-9a9a-f05a486d13d7","resolution":{"observed_at":"2026-08-07T10:36:04.877110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.777850Z","title":null,"venue":null,"work_id":"4dfc348f-e3bf-4f76-9a14-aaa8254ce0c4","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.207458Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:bbcef96cf4b82d9d6b6ea60678754aa2dca6a0eec98a9268af9791dab28d0ef3","observation_id":"19c2d0ed-9252-4fb4-a7f4-1523034c1e75","resolution":{"observed_at":"2026-08-07T10:36:04.794972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.720676Z","title":null,"venue":null,"work_id":"f23088ca-79da-440c-8ed0-0a9de2874d10","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.263934Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:286689de57de055f790544339e59d8ddcf204867ac78dc74e3c1681d7baf9ed5","observation_id":"93cededb-216f-4353-96b7-e98981c165ab","resolution":{"observed_at":"2026-08-07T10:36:04.744172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.654098Z","title":null,"venue":null,"work_id":"d48d9ae2-a4fd-4958-984c-934882808ae7","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.336074Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:927eae1fe464d20133b9e5da0d0caccb80f38874296f67451e6ff428c65fea31","observation_id":"a3c08d5c-115f-451d-aa63-d8a87d64f85c","resolution":{"observed_at":"2026-08-07T10:36:04.686487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.572876Z","title":null,"venue":null,"work_id":"120636bd-abde-42c5-8507-4d4157281386","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.402866Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:89b715d61102583e843e9bac78d6131d96395649b4b3f771e0844dd0a1d58d31","observation_id":"e26ac464-1600-40d0-a5c7-8eac7cf39a4a","resolution":{"observed_at":"2026-08-07T10:36:04.606814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.499590Z","title":"and Bareinboim, E","venue":null,"work_id":"49f144a8-52e2-49ff-960a-bec9e191441f","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.466460Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:7860c1e95ad427a13dd23acb20a0f3b42ede1a99ac6f894f02b59b424bd26be3","observation_id":"1bb3ecff-3de4-4781-a77d-9f9581352569","resolution":{"observed_at":"2026-08-07T10:36:04.529392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.440717Z","title":"and Bareinboim, E","venue":null,"work_id":"5ed31898-a507-4267-a3cf-328030eb8614","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.519671Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:244925180de5d03fabac6c2b6d7706587432b9d04d998c0e92d3dc59d9e8642a","observation_id":"1c900d36-b428-43cd-bbd6-7f6eb859d864","resolution":{"observed_at":"2026-08-07T10:36:04.470713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.364576Z","title":"P., Hunt, J","venue":null,"work_id":"05c5cf42-c1b3-407b-a233-bbe4c100eab7","year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.574314Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:9ca75d86ac46681e9abac16771e4a5b718546303f95b6a3cb95c35eb748dcd1c","observation_id":"a5195288-9cf4-4d74-8860-25e085d20bd6","resolution":{"observed_at":"2026-08-07T10:36:04.392073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T10:35:57.644181Z","title":"P., Hunt, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.644181Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:a783f98068cc684452a952ca55f8a97b18c67bd1e2b343754804712dcf032e3d","observation_id":"1f25f871-a3d6-4f61-b15e-c6f07e9ebbbd","resolution":{"observed_at":"2026-08-07T10:35:57.644181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.313591Z","title":"and Krishnamurthy, A","venue":null,"work_id":"8f7ca7ee-4484-40da-9134-d0e98f7ea492","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.711279Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:7d0701da0a1b06e4b2db58d5fdf165402b543937329f9cee16842608e214982a","observation_id":"94d44d67-9b6d-4e78-b265-4a61b205d29e","resolution":{"observed_at":"2026-08-07T10:36:04.330213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11089","last_updated":"2020-02-25T18:36:31Z","snapshot_observed_at":"2026-07-06T09:00:04.280961Z","submitted_at":"2020-02-25T18:36:31Z","title":"Rewriting History with Inverse RL: Hindsight Inference for Policy Improvement","version":1},"cited_work":{"arxiv_id":"2002.11089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.11089","snapshot_observed_at":"2026-08-07T10:36:01.256639Z","title":"Rewriting History with Inverse RL: Hindsight Inference for Policy Improvement","venue":"cs.LG","work_id":"e08817fa-7463-4791-959b-ed99a29b6256","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.781252Z"},"links":{"cited_paper":"/paper/2002.11089","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:9b98bb4041ccf589e2fd80f4a6b7c7b748b164e9817a66592f1f507a6aee3a68","observation_id":"254e7504-a210-4e33-9413-903c850d747a","resolution":{"observed_at":"2026-08-07T10:36:01.307595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.239436Z","title":"V., Sima, K., and Leong, T","venue":null,"work_id":"2838514e-a664-4dcb-a657-5570a12ea1ff","year":2025},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.852453Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:c611b092b1f0cdee585b89b95dbd540580f53e65f222f85b0efdceccf5f8240b","observation_id":"100ddbe6-78c6-4a76-95b9-2d421e05afc1","resolution":{"observed_at":"2026-08-07T10:36:04.277446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.216791Z","title":"V., Fu, D., and Leong, T.-Y","venue":null,"work_id":"fa381006-886f-4e93-a286-85d9e706be08","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:57.918663Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:656dcecdbdcdc93ab49c08ca422c365dc5efd2246158fd5b79a04174555e0c5c","observation_id":"cd705998-f34d-428b-b67f-219cefb0ea64","resolution":{"observed_at":"2026-08-07T10:36:04.223838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.191995Z","title":"V., and Leong, T.-Y","venue":null,"work_id":"c2095bb9-e1df-4536-b046-cb739cf84530","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.008523Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:daa81aa36063527ed12f5042641f6da89144eb9449f0a21f7b6b774f4cb293b1","observation_id":"169f980f-2cc9-41a2-b6cc-4eb0f12180f6","resolution":{"observed_at":"2026-08-07T10:36:04.201758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.159665Z","title":null,"venue":null,"work_id":"0f98a56c-30fc-4002-8664-a555c6f904f7","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.116971Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:7b09120a2cfbe1aba2f7589c58987be20a6bdd14da924a210ca562f800ff05d3","observation_id":"08ee4ad2-093f-4500-914e-d302f1fdeed7","resolution":{"observed_at":"2026-08-07T10:36:04.173753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.122600Z","title":"and Sontag, D","venue":null,"work_id":"430b6bed-fdc6-4f34-818f-440866bccd97","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.205073Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:8c380535a6e00e07a152f5553c0417042851c339240187663817201af657becb","observation_id":"cf3d0505-6724-4442-8426-b9eb59d5a31c","resolution":{"observed_at":"2026-08-07T10:36:04.138332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.090828Z","title":"o lkopf, B., R \\","venue":null,"work_id":"a6dc8cd5-4bd1-460c-93b8-865e7b073fed","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.290756Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:59321759154bb76bdb08fbc7039480d3a996340ce0d899e5bdab5d68f270c312","observation_id":"14a94d8c-10b4-4183-af31-0c2e57d9b490","resolution":{"observed_at":"2026-08-07T10:36:04.099722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.063370Z","title":null,"venue":null,"work_id":"fa2d7b49-d905-4205-ad82-1604362a2197","year":2009},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.377118Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:5fc1f7ac823541414be70c381df162e3664c73321032f50253255ab4353c5ee7","observation_id":"581578b9-8bdf-4b87-9b1e-d95a612d4adc","resolution":{"observed_at":"2026-08-07T10:36:04.072534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.038432Z","title":null,"venue":null,"work_id":"b50902a2-a349-4633-8d16-582aa678e8bb","year":2009},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.488977Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:db96fa71cd9f027cfbc81908578f29a20310e31a0911b2fb9d2c86173f514708","observation_id":"e968b5eb-b467-4199-881c-78b8a88897fa","resolution":{"observed_at":"2026-08-07T10:36:04.045301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07536","last_updated":"2022-12-14T22:43:56Z","snapshot_observed_at":"2026-08-08T07:01:25.137948Z","submitted_at":"2022-12-14T22:43:56Z","title":"Robust Policy Optimization in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07536","snapshot_observed_at":"2026-08-07T10:35:58.559435Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.559435Z"},"links":{"cited_paper":"/paper/2212.07536","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:c341fbefd579a101620a7c9bf1f8995fb17b8eb4665b892627523c705497ff01","observation_id":"217fafc5-d441-4cde-a5b1-50b4c0ab6376","resolution":{"observed_at":"2026-08-07T10:35:58.559435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:04.015823Z","title":null,"venue":null,"work_id":"a2715f06-9de4-498e-8465-864737cb01dd","year":2023},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.624485Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:c1f21019e8579c0f439e395329507264e90a31999c2377f4d58335850c2e5f69","observation_id":"4fc2e2ad-4e12-49c6-800c-3f5284aa57b3","resolution":{"observed_at":"2026-08-07T10:36:04.023254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.994445Z","title":null,"venue":null,"work_id":"a9c7bc1e-3663-4bfc-8d18-b8ffeedb914d","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.710725Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1dce249d277a9e58a15c3a6177cd6f5e97e0459251a3558c79fc66ba903a97b7","observation_id":"9d0de39e-ea15-431c-b06e-bd4542495984","resolution":{"observed_at":"2026-08-07T10:36:04.000514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:35:58.897292Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:58.897292Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:2323a5380c8a361d028cc5573a177c3da5728e1f50a2eaa42eef7f3eb3fcd833","observation_id":"402f2e2e-4070-4651-aad8-3c837732275a","resolution":{"observed_at":"2026-08-07T10:35:58.897292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.973366Z","title":null,"venue":null,"work_id":"17965b09-14f5-4c49-8cf6-9bd6b0ac46d9","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.021496Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:59ae2e2090823f21880062b4138f5cc82300ea95b6f98aa19f9dfaacf860f08c","observation_id":"48daab15-c73f-4d61-a90a-335b1c953714","resolution":{"observed_at":"2026-08-07T10:36:03.979816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.947980Z","title":"A., Mehrjou, A., Itti, L., and Sch \\\"o lkopf, B","venue":null,"work_id":"04cc396c-2778-4cd3-8fc9-68e45d58a31b","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.121778Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1b50b5eff4fb86d2e5418d68748bec9f9dfa28cd5511673490e1551e7eeea8fa","observation_id":"8daf1743-76ff-4305-9b2c-f5d5373ddb91","resolution":{"observed_at":"2026-08-07T10:36:03.958176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:59.244632Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.244632Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:1ae082d11a205e8c817862d43daedfac44bb7c531ea6cc49da4af31e24cac947","observation_id":"c5b5fe2e-7771-4e7e-9717-807af026f026","resolution":{"observed_at":"2026-08-07T10:35:59.244632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.788212Z","title":null,"venue":null,"work_id":"d9f61e06-f073-44fc-a4ac-5effa4ebbe7b","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.407242Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:38545a7cd1c0cf39fffef6c42dd7a6e4da2d0142c3bf028c5282ea98b8ec9ea5","observation_id":"3352881e-78dc-4e8d-93d7-ad8bbee579a2","resolution":{"observed_at":"2026-08-07T10:36:03.864149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.562322Z","title":"V., Bhattacharyya, A., Lee, Y., and Leong, T.-Y","venue":null,"work_id":"25bb0688-33ea-4799-82e2-4ff3217656fe","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.524679Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:c517d3ccd63cd50b2009fdfcb1ded4c2448405ed58d501aaa26a4b3f30fad213","observation_id":"4fac4cf2-e0b3-47da-87f2-e820812baf33","resolution":{"observed_at":"2026-08-07T10:36:03.723703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.247156Z","title":"V., Lee, Y., Hoang, T","venue":null,"work_id":"d742ac7b-b738-46b9-837f-8116a47126ee","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.653506Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:d517589d8ee50f461c1e4f48b7e24308088e9ef3bb1b3fa514b9bb994fea9db2","observation_id":"d8dd8711-3e83-4881-b14d-2ab66946ff93","resolution":{"observed_at":"2026-08-07T10:36:03.388402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:03.060002Z","title":null,"venue":null,"work_id":"114beaa2-7b39-47f0-b3d2-8daccc7daf49","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.776828Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:554ae9bba4797d8f6ebd79416f30d596e35a0efe11a88632caf437fff0e09e98","observation_id":"bfa7acdc-9448-4e86-9ce1-1a13d2e9f8a9","resolution":{"observed_at":"2026-08-07T10:36:03.121133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:59.919306Z","title":"T., and Athey, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:59.919306Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:17bf4ca25334a0e1bdf0d389f819b7808b0254827cf00cd757ecfb7fdbf7b766","observation_id":"1af0e510-f2e3-4913-8113-8e41f75d71a1","resolution":{"observed_at":"2026-08-07T10:35:59.919306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.887672Z","title":null,"venue":null,"work_id":"d6522ec0-b91f-41a8-ac80-d6f4190e78da","year":2024},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.076368Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:482b31127da23ec52e3f3b34e318ace7d69ef6cf1feba6de95dab9e062995a95","observation_id":"db3c2665-14ee-4a57-9ddb-ebd1843af036","resolution":{"observed_at":"2026-08-07T10:36:02.970054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.699150Z","title":null,"venue":null,"work_id":"1ead71b7-2488-41c6-b670-8bd4e0a6db3a","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.191439Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:f787453136474e2b35c208c3fcfc392c112785803cbccbc5b7f5835e564f8a29","observation_id":"c0da3255-67e7-4351-81f7-c722802bac01","resolution":{"observed_at":"2026-08-07T10:36:02.787674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.481500Z","title":"and Bareinboim, E","venue":null,"work_id":"9dfaaa68-c542-4679-a926-556fe4333f05","year":2016},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.346427Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:71cbdaf3ad9fb3f247edf0097484db784a3e6afb2c65eeb3cd74bb8b60825bfd","observation_id":"32c8258f-d0a5-4952-8da4-b8b519314caa","resolution":{"observed_at":"2026-08-07T10:36:02.590333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.328215Z","title":"and Bareinboim, E","venue":null,"work_id":"0dce6170-abd5-4946-b03b-0807cd70e4eb","year":2019},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.501633Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:99a21d55bbf1e83a51bde87ffe35d95a6e6b83c002bb550a49bcfcdb9c0eb3bb","observation_id":"c21a2795-aca7-4916-b332-982f024c8b3f","resolution":{"observed_at":"2026-08-07T10:36:02.404749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:02.157696Z","title":"and Bareinboim, E","venue":null,"work_id":"344093e0-7815-43ca-91cb-15661c0a2c64","year":2021},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.671471Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:762d602e91132aee641afd397f5b452664514680ebd7c4dcc73af12498e96807","observation_id":"68da7043-9bbd-49a3-8a32-de12c8a35dec","resolution":{"observed_at":"2026-08-07T10:36:02.249365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.969679Z","title":"and Bareinboim, E","venue":null,"work_id":"4e56d806-a264-4ebd-b317-dc84e2d60e52","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.792691Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:7b253a1a45ce86d84eab009b82a95d1a0977ec07127641acccf52bf1a7b7d8ae","observation_id":"23686f90-8263-4ecb-a308-ad80d9cc31a7","resolution":{"observed_at":"2026-08-07T10:36:02.052297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.828195Z","title":"and Bareinboim, E","venue":null,"work_id":"077e45d7-e849-4427-8d6e-a30369ac472f","year":2022},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.884611Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:4b00e49d8af934eb984263322954d6d8fcf47f4b0c55006bd0d1bbf1561509fa","observation_id":"0adad830-802a-444e-aef3-221fd80f7c2c","resolution":{"observed_at":"2026-08-07T10:36:01.892224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.652756Z","title":null,"venue":null,"work_id":"914134a6-c868-442d-8d43-ab8f907c2fb3","year":2020},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:00.981793Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:a1d306528bf8802b65c1b87538d482580c9e13e63266573804d709335d2f2ead","observation_id":"30a6359d-8f35-45dc-9155-a15bfcea025c","resolution":{"observed_at":"2026-08-07T10:36:01.747435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:01.464095Z","title":null,"venue":null,"work_id":"259a0322-318e-4a7e-b578-8d09dff28bd8","year":2023},"citing_paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:36:01.072056Z"},"links":{"citing_paper":"/paper/2506.05445"},"observation_digest":"sha256:3052c4ff5df02fb3c9eb8896b00601c3540485cd34c2daa77bfb5438ef5e3fe0","observation_id":"d1c23697-be22-4220-a151-691c6b834a31","resolution":{"observed_at":"2026-08-07T10:36:01.551087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05445","last_updated":"2025-06-05T13:52:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:24:36.469912Z","submitted_at":"2025-06-05T13:52:38Z","title":"Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2506.05445."}