{"as_of":"2026-08-24T03:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0a05fcaacb1c7fe40c5fbfa19c060e0f5880dc739bc0769bcf0a491de652f22","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:03:10.619048Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11088/citation-record","integrity":"/paper/2411.11088/integrity","json":"/paper/2411.11088/citation-record.json","paper":"/paper/2411.11088"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.455675Z","title":"Uncertainty-based offline reinforcement learning with diversified Q-ensemble","venue":null,"work_id":"1ba4142f-759a-4209-b38f-6550514862c6","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.362106Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:b7682370eeb0d70b2d711101d5358e4f37f86a8a9f65622bb5c58410a6cd700c","observation_id":"749f8502-9f40-4b75-94d9-ed3dc1a3c397","resolution":{"observed_at":"2026-08-12T19:03:11.460628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.444682Z","title":"Model-based offline planning","venue":null,"work_id":"b52cdcdf-fc81-45f3-875e-2b601b797dec","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.366451Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:ec9001a005c5334b86c47ca822aa56e0f7a325aa9f1b01be9013738e6b562b86","observation_id":"b0468006-ef01-40d3-bfcc-e6608cdfc0dc","resolution":{"observed_at":"2026-08-12T19:03:11.448461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.370408Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.370408Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:a0e575af59d672b9a67b9d1af3f9801af9cac3242e3f2bc4e215d46bb1b53e44","observation_id":"b159359b-d497-4700-9b0a-500157e7a330","resolution":{"observed_at":"2026-08-12T19:03:10.370408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.424270Z","title":"Balancing policy constraint and ensemble size in uncertainty-based offline reinforcement learning","venue":null,"work_id":"24b39e19-a6af-485a-9ee8-8779bbbea61c","year":2024},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.374750Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:15f0c163d61f8f0a3b1d2461d26a495ed3cdc66276cf8cc9165c04064cef4a1d","observation_id":"f582a85d-8be9-4099-b0a9-db6f6e72ab3c","resolution":{"observed_at":"2026-08-12T19:03:11.428291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.413012Z","title":"Offline RL without off-policy evaluation","venue":null,"work_id":"f78361c1-7e82-4592-821c-188986da6f6b","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.378583Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:ff66d0effe3ea1d4f2915947d72939c8cc75bc5955805161419d376ba3d42128","observation_id":"25a72a6c-9575-47ed-96c4-ac7c1494c0b7","resolution":{"observed_at":"2026-08-12T19:03:11.416467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.401742Z","title":"Learning action representations for reinforcement learning","venue":null,"work_id":"ae653c62-a9c3-413d-ab51-bc8e916d59af","year":2019},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.382271Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:cee295d0442b795c206a624a40aa275f071e4fd6b21667e8a7f35352265b758d","observation_id":"d58fc196-dfd1-4c73-b7ab-7c2425323345","resolution":{"observed_at":"2026-08-12T19:03:11.405457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.389481Z","title":"Q-transformer: Scalable offline reinforcement learning via autoregressive Q-functions","venue":null,"work_id":"3659ebd5-4047-4659-9557-69a832486eb1","year":2023},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.386150Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:bf0d4313b4029893a941a183d1b30adc01781b042db20b32a479e441862e545b","observation_id":"857b78a9-c946-4d05-ad18-88788133b6e8","resolution":{"observed_at":"2026-08-12T19:03:11.393616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.378355Z","title":"The dynamics of reinforcement learning in cooperative multiagent systems","venue":null,"work_id":"8c093911-77f7-4fe0-84fd-ef0f601a5977","year":1998},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.390902Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:d3461039a49798f74991264c78dc5b8fb5c0b45997cc9ed281ddd511820556c3","observation_id":"021440f1-7db9-4e6d-8e49-8fd512a8aac0","resolution":{"observed_at":"2026-08-12T19:03:11.381905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.366830Z","title":"Deep visual reasoning - learning to predict action sequences for assembly tasks","venue":null,"work_id":"e9ad71c8-e9d6-44ee-be66-99c7c0814e87","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.394873Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:52e1e5f8b98f04b6d9d4c0971555b4be384322227301a34cdc1e8783b7e0a48e","observation_id":"6b3a75aa-9c8d-4287-9ec4-cc90a1b104ea","resolution":{"observed_at":"2026-08-12T19:03:11.371057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.354413Z","title":"Value function factorization with dynamic weighting for deep multi-agent reinforcement learning","venue":null,"work_id":"6fb5dc44-fbd6-4fc1-acd4-00e51603eca3","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.398851Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:0b196fe727f013fb8e3ea0a1fa440bf9ec361d0c534cda112c92b529d320869e","observation_id":"74fd7b69-67ef-4b26-91b4-d6e56da46dcf","resolution":{"observed_at":"2026-08-12T19:03:11.359005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.07679","last_updated":"2016-04-04T11:27:36Z","snapshot_observed_at":"2026-08-14T22:17:08.384245Z","submitted_at":"2015-12-24T01:31:40Z","title":"Deep Reinforcement Learning in Large Discrete Action Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.07679","snapshot_observed_at":"2026-08-12T19:03:10.402715Z","title":"Deep reinforcement learning in large discrete action spaces","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.402715Z"},"links":{"cited_paper":"/paper/1512.07679","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:efb2a52979ae65859cb9b60a41547a05ff6f0fd7254d268eb500d8f637eaa01b","observation_id":"bd86cd62-fd5d-4cf3-9bf3-a3965773e0da","resolution":{"observed_at":"2026-08-12T19:03:10.402715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.342501Z","title":"Growing action spaces","venue":null,"work_id":"07a5a41a-e70d-4cf8-a315-fbaccf86fcdf","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.408371Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:738d4aa5094dc88597f49a9333dd221f6fa3d4642c55ea75a6844d8dc615f8fa","observation_id":"dfdd3a67-a0fa-4438-a90f-123165eeacc2","resolution":{"observed_at":"2026-08-12T19:03:11.346303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-12T19:03:10.412204Z","title":"D4RL : Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.412204Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:581e9233f9b2d92bbeef843896da6c0e6940a8bedc0d6ba925f2eb7cc2a51acf","observation_id":"87abe69c-51b6-4503-9b57-2b0ae7c081f2","resolution":{"observed_at":"2026-08-12T19:03:10.412204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.330915Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":"5f2ee5de-faae-4bba-a710-3a9cda0e8d13","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.416237Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:b37d336941fe9c9167002707147281f5da1f55d8bdb2a9b03a7ad349d22ddf7a","observation_id":"6bbf57ef-247e-4efc-b255-30c90bb31930","resolution":{"observed_at":"2026-08-12T19:03:11.334908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.419927Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.419927Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:c1764e35a07bdedb525743d3f2e301b36ee403216a63df2d2d905d2ce5909476","observation_id":"a1bb01bb-442b-4914-b687-e5edcb645c1a","resolution":{"observed_at":"2026-08-12T19:03:10.419927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-12T19:03:10.423609Z","title":"Benchmarking batch deep reinforcement learning algorithms","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.423609Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:9ab239938a9c8b55b7ca54c79bcf0dce6b7a7e836f8d23055ed010178ba96211","observation_id":"10774b93-9586-4dc5-adb2-f478da525fe6","resolution":{"observed_at":"2026-08-12T19:03:10.423609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.311874Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"670771cc-1e91-4408-8424-569733106e0b","year":2019},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.427865Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:da8a70ebff5eb3b46b3911f7219e38cd2444ad8f854de3ba7d28fcb7a33de4e5","observation_id":"7cfbce22-5b08-4573-b027-9c73c663fb99","resolution":{"observed_at":"2026-08-12T19:03:11.315971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.299313Z","title":"Q-learning for robot control","venue":null,"work_id":"eefe94a6-b492-405d-b060-db2e31caaddb","year":2002},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.431569Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:2b358768d57bc418c78f1b64291b235c5819fe2f0dceafcb92dfc0d384a12d23","observation_id":"926af992-c702-4b00-9ccc-4afdc17cea4e","resolution":{"observed_at":"2026-08-12T19:03:11.303225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.287333Z","title":"Why so pessimistic? estimating uncertainties for offline RL through ensembles, and why their independence matters","venue":null,"work_id":"b4e9f49b-a394-45cc-a68b-4f755d673ae8","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.435227Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:12a0cc36f0efb9adeaa71dc53635233152f55c1dcf11305e5a44e7acb5ad76de","observation_id":"25c2fd69-746b-4dcc-91c0-a7000721a559","resolution":{"observed_at":"2026-08-12T19:03:11.291527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12298","last_updated":"2018-05-31T02:56:26Z","snapshot_observed_at":"2026-08-14T19:09:12.316446Z","submitted_at":"2018-05-31T02:56:26Z","title":"Evaluating Reinforcement Learning Algorithms in Observational Health Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12298","snapshot_observed_at":"2026-08-12T19:03:10.439159Z","title":"Evaluating reinforcement learning algorithms in observational health settings","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.439159Z"},"links":{"cited_paper":"/paper/1805.12298","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:14d9641cd586385ac39ea2b170a057a644dd0ebb5e9cdc6639aad7eb3961b827","observation_id":"9a57e88f-3bae-4844-8496-7a3b9c418607","resolution":{"observed_at":"2026-08-12T19:03:10.439159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.276276Z","title":"Learning pseudometric-based action representations for offline reinforcement learning","venue":null,"work_id":"0c41b04d-bbce-4878-971a-e5922a271b10","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.442505Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:3c0af68d314454795463ed65a331e230f3050ba51d163a8f09e958a6605c4c4f","observation_id":"253796a6-176b-407c-89ea-792783f1775f","resolution":{"observed_at":"2026-08-12T19:03:11.279861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.265868Z","title":"Efficient solution algorithms for factored MDPs","venue":null,"work_id":"80ffdd91-85f9-41ea-95ba-0c548e4bde50","year":2003},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.445726Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:57d575afdb17f86e7dc6162eecfa708be285c64d41f905e8d102e21d8ae5407a","observation_id":"67773c32-af0b-416f-9d0e-170149a9d35e","resolution":{"observed_at":"2026-08-12T19:03:11.269418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.255502Z","title":"Addressing extrapolation error in deep offline reinforcement learning","venue":null,"work_id":"0dd06cd4-efbe-49cc-90c9-e40fb2a362ce","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.449025Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:48e36ceec506e01e756e7e5d8808591bab764a69f51ed3c3af681d55b6b0dee3","observation_id":"cc55722f-4388-4a5e-ade7-b53c3857aaec","resolution":{"observed_at":"2026-08-12T19:03:11.259039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.242747Z","title":"Rl unplugged: A suite of benchmarks for offline reinforcement learning","venue":null,"work_id":"f7705ce0-872a-4cbd-ac11-8def3f4658bc","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.451988Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:884d43b77c61bd34357a7618b7d144074e8464b3ada6e2b0288110a109a02350","observation_id":"89c9d8f8-66ef-4572-9b9f-5106a487e404","resolution":{"observed_at":"2026-08-12T19:03:11.247077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.229621Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"8c68db47-5c21-4d06-a32a-776d329e35fa","year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.454963Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:fcaee0ea96c1c957aaf968fd1d2ba8c9ae2e245facf843d69630c3e96f91a791","observation_id":"2a5989c3-19df-4335-b0a6-c03680d7a1ba","resolution":{"observed_at":"2026-08-12T19:03:11.234348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.457928Z","title":"Distributed prioritized experience replay","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.457928Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:20fbc225361a3f09516d691ecc2ce7f31b763077b54f1579b2ceee331d78ea49","observation_id":"84a67943-1776-4f65-85bf-dfea4baa8eaf","resolution":{"observed_at":"2026-08-12T19:03:10.457928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.209184Z","title":"Learning and planning in complex action spaces","venue":null,"work_id":"93559c62-e901-46f9-afde-9e65b70c6271","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.460844Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:dc0da79b9076b5d6aac99129db8e298061d8476908dd13c61928328428ecb61d","observation_id":"df5e5766-7fac-464a-8fdc-d55a651b915f","resolution":{"observed_at":"2026-08-12T19:03:11.213554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.196175Z","title":"Revalued: Regularised ensemble value-decomposition for factorisable Markov decision processes","venue":null,"work_id":"9ff96879-5dfe-4fe4-abe2-af3648e75a73","year":2023},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.464243Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:06ec06a218488b4b608bb6f2862d3bb85b73137c4388296187dedd3183d727f4","observation_id":"9b3fe3ab-0316-4d50-a870-f038da66ad7c","resolution":{"observed_at":"2026-08-12T19:03:11.200751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.184291Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"2bf8307c-3484-4cf3-97b3-879007ede75f","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.467450Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:9d2ebbf96ffdbc12c8cc90bca509654b41773aa7b4882f82cf4e2b7b618bae75","observation_id":"416971c4-2da5-42c9-8d1c-4eeb657dedc8","resolution":{"observed_at":"2026-08-12T19:03:11.188494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.470988Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.470988Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:06a682970d1ea9b750cc1ff8c5f9032b882d31cd8116e4d08f85c5286f2a2932","observation_id":"babaabdb-4031-4cda-bd8b-5b7356c91b11","resolution":{"observed_at":"2026-08-12T19:03:10.470988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.163982Z","title":"Efficient reinforcement learning in factored MDPs","venue":null,"work_id":"a94dfda4-4a05-4e34-8ab3-39e1de56d49b","year":1999},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.474579Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:0d6478a220f7a1762ca52e4d65396a457f537309262a0d2875e26ce130381e1d","observation_id":"21b95b16-5269-4173-9b8b-45194f4789f2","resolution":{"observed_at":"2026-08-12T19:03:11.168141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.150565Z","title":"MOReL : Model-based offline reinforcement learning","venue":null,"work_id":"aca04cf5-37ef-4d78-a311-cead4c2e946e","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.478100Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:5640aa324e2ca327df9b61a8c1fb167c49500f97b704442c1c772c820b72aaab","observation_id":"626988be-1b28-471c-a03d-b1f1d461101f","resolution":{"observed_at":"2026-08-12T19:03:11.154808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T19:03:10.481505Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.481505Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:ad356b115a30db09eec2e221de1ee16b7b97e4a6f010708ad111c6274a8096ac","observation_id":"0a94f202-da42-486c-9de2-492ac413f4cb","resolution":{"observed_at":"2026-08-12T19:03:10.481505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.137510Z","title":"Al Sallab, Senthil Yogamani, and Patrick Pérez","venue":null,"work_id":"e3dd216c-1215-415d-ae82-500bf6322b32","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.484784Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:752093279deb711c8ff56b472d305d25e1e09e96dc8101785c913240884ba499","observation_id":"e714f0af-3431-4f31-879c-41a872cae939","resolution":{"observed_at":"2026-08-12T19:03:11.142356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.121766Z","title":"Offline reinforcement learning with Fisher divergence critic regularization","venue":null,"work_id":"2b4e2cec-8427-4c4f-b999-698e4d3715c3","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.488426Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:21313e60e29fb3baa0e98e74776df5279e141a6074941e73429bff2d471a4853","observation_id":"3d7a6251-7510-4dbd-9a5a-2f97013aa336","resolution":{"observed_at":"2026-08-12T19:03:11.125587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.109957Z","title":"Offline reinforcement learning with implicit Q-Learning","venue":null,"work_id":"e986a413-6f3b-4c51-8b1e-04d942b8172b","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.492430Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:41570d1437fe525bafd82e93b55b3efa0bc1a2c0fd76f55bb87f3c2319913ad0","observation_id":"58fb6db3-dc3c-4ee4-b487-cf6267e6315b","resolution":{"observed_at":"2026-08-12T19:03:11.113831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.496254Z","title":"Multi-agent reinforcement learning as a rehearsal for decentralized planning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.496254Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:e2747b3a55609e76e77d023165410b88515b16a22f1aa63d8bf28c92e938afd5","observation_id":"e0c2110a-bfe4-4ff2-954f-31375e7c328e","resolution":{"observed_at":"2026-08-12T19:03:10.496254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.089125Z","title":"Stabilizing off-policy Q-learning via bootstrapping error reduction","venue":null,"work_id":"ca62e34b-8348-4792-a509-8960d7353ff9","year":2019},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.499774Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:684cc244380b6ba0753a2a8a26d889b13bd417983b1b88980957416553165aa9","observation_id":"0fe6e26c-5fe5-4392-a2a4-51790e31eb46","resolution":{"observed_at":"2026-08-12T19:03:11.092800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.077263Z","title":"Conservative Q-learning for offline reinforcement learning","venue":null,"work_id":"67d6886c-14c4-47a2-96da-79415a0be978","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.503443Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:e012acb70e819e4098b61f60453a6d6ac611f84aacb6f9ec05a8befd31d2b618","observation_id":"6397d9d5-6d8b-419d-be67-816ab20c37f7","resolution":{"observed_at":"2026-08-12T19:03:11.081474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.062736Z","title":"Batch reinforcement learning","venue":null,"work_id":"578ac306-9204-415c-bf2b-c6021f2934ff","year":2012},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.507032Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:a3c3739f540d54a0592b9431f0da5847bf1f342532afca870c4de0cd839e58a4","observation_id":"482667be-589a-44a7-b1f0-a3a6ea0e5f05","resolution":{"observed_at":"2026-08-12T19:03:11.067990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-08-21T15:57:22.153221Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-12T19:03:10.510469Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.510469Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:c0a7e5c75c21b93d9b3276b92f5011c1d496c4f2c48b91911dc1c1f800b53a77","observation_id":"92ab5873-4f1f-4cea-bb2f-3b4fcc7727e4","resolution":{"observed_at":"2026-08-12T19:03:10.510469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.048662Z","title":"Efficient large-scale fleet management via multi-agent deep reinforcement learning","venue":null,"work_id":"974fcae5-2cbd-4c07-94a9-24daa178a48c","year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.514148Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:b48aaaa7cc37d3ee6f72b0a9de3312b859e7c46779511b0a7ff8508057960aab","observation_id":"d0492a9d-cff5-476e-a5cf-41f08b30b80c","resolution":{"observed_at":"2026-08-12T19:03:11.053022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.036744Z","title":"Reinforcement learning for clinical decision support in critical care: comprehensive review","venue":null,"work_id":"d6132761-8d69-4c35-8c61-a6c363bc9a12","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.517962Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:f1b908a460b99f1561d7e053bed7066c02f53995e2c5fdd1661838cd63640367","observation_id":"eaac4c8f-7871-4b17-9b51-0323444cf9f6","resolution":{"observed_at":"2026-08-12T19:03:11.041123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.020322Z","title":"Action-quantized offline reinforcement learning for robotic skill learning","venue":null,"work_id":"3b494c32-e077-4fae-b522-e841c812c0f0","year":2023},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.521881Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:6b8998fc520bdb2a2de8ec5022dc8d282a5c50a07edec912f83a4313198963b4","observation_id":"aa51d450-5569-4890-887a-d9b9c2f8a8e7","resolution":{"observed_at":"2026-08-12T19:03:11.026124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:11.004203Z","title":"Benchmarking reinforcement learning algorithms on real-world robots","venue":null,"work_id":"0a3879a6-b34b-4329-be02-a1cc92928449","year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.525625Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:e1573c53dc18539a2f68061f0b5d017cb7a6b81350b775a2b6c6b5c7eac579bc","observation_id":"89284f3e-4c10-46e3-a682-0db39c9ca5de","resolution":{"observed_at":"2026-08-12T19:03:11.011307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05035","last_updated":"2019-06-08T00:56:16Z","snapshot_observed_at":"2026-08-14T21:00:48.813378Z","submitted_at":"2017-05-14T22:53:13Z","title":"Discrete Sequential Prediction of Continuous Actions for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05035","snapshot_observed_at":"2026-08-12T19:03:10.529390Z","title":"Discrete sequential prediction of continuous actions for deep RL","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.529390Z"},"links":{"cited_paper":"/paper/1705.05035","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:0de5bee03d83edb6cd832bca51be1e4e738e41173794bf861d7d8bc4277997b9","observation_id":"cd53f65b-3894-4e0e-bb6b-debdafa96aad","resolution":{"observed_at":"2026-08-12T19:03:10.529390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T19:03:10.533498Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.533498Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:680c66f6f817befa394e19a3b27d50ef6e2757dd80855550d1592b7dc088a554","observation_id":"926ff78f-ebe2-4c76-89cf-6cd8f2e81b16","resolution":{"observed_at":"2026-08-12T19:03:10.533498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.537601Z","title":"Anti-exploration by random network distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.537601Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:ef7916671de0046c1aa2cacffda0344683016d30854a5b0b2f552d28840f805e","observation_id":"7b7926a9-c6e7-4acf-bb96-c22c647a7f43","resolution":{"observed_at":"2026-08-12T19:03:10.537601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.984317Z","title":"Factored action spaces in deep reinforcement learning","venue":null,"work_id":"cdbb5011-797f-4da7-ba46-eb7e489cae26","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.541576Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:21798553154e00228e1411bce96e2d76cecfa779acdb2b1864c0914244a314c8","observation_id":"da00f59f-5e12-470d-a0a4-8442804b6696","resolution":{"observed_at":"2026-08-12T19:03:10.988698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.972790Z","title":"Weighted qmix: Expanding monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":"ccafed5b-f643-4fca-af5b-44e13b37f273","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.545119Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:7d097da86fce84da7c9338b5d07c06721a77b4a7dde6163815ad5431ea242598","observation_id":"6549ffa9-b9d2-4dc4-a43d-8dbf0ffc9911","resolution":{"observed_at":"2026-08-12T19:03:10.976741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.961481Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":"033924a6-e52f-40ca-b00f-b44626afff02","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.548563Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:56d7750dac310402bbed42dec481e56e1ae10b58e3c22c91fe4bb35ca1b5f25d","observation_id":"e319e4c0-9e27-4c1e-9055-4699a7e52e34","resolution":{"observed_at":"2026-08-12T19:03:10.965680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.949935Z","title":"Leveraging factored action spaces for off-policy evaluation","venue":null,"work_id":"7f37a32d-a663-4439-8a30-b2472e2c8bea","year":2023},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.552022Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:74939d99363eb3a13f9b45e9ae0a23ee40eab58adfa7ab2fa900f8524b29dce3","observation_id":"de7082fb-8e4c-450c-9f41-e621efe6ba36","resolution":{"observed_at":"2026-08-12T19:03:10.953730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.938834Z","title":"Is bang-bang control all you need? solving continuous control with Bernoulli policies","venue":null,"work_id":"aeb95e1c-1dbd-4923-8095-9b85a0c1ba35","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.555024Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:de156fd01492b5df8eff7e7054b06680ffbca93522dfce3181c50bd4741393fc","observation_id":"66922058-57ee-4157-86db-50125ea965e1","resolution":{"observed_at":"2026-08-12T19:03:10.942902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.926379Z","title":"Solving continuous control via Q-learning","venue":null,"work_id":"2c5a3181-589b-436f-9801-5d768226951a","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.557908Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:5826fcafeb1f9004ad956f4b9cfebbdd8660532d51c4693a8260363eebbbad29","observation_id":"d31d347b-2aa4-49e6-a28d-41688555a41d","resolution":{"observed_at":"2026-08-12T19:03:10.930456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07269","last_updated":"2017-05-20T07:18:40Z","snapshot_observed_at":"2026-08-14T20:59:23.657540Z","submitted_at":"2017-05-20T07:18:40Z","title":"Learning to Factor Policies and Action-Value Functions: Factored Action Space Representations for Deep Reinforcement learning","version":1},"cited_work":{"arxiv_id":"1705.07269","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.07269","snapshot_observed_at":"2026-08-12T19:03:10.690071Z","title":"Learning to Factor Policies and Action-Value Functions: Factored Action Space Representations for Deep Reinforcement learning","venue":"cs.LG","work_id":"7ae1f2a2-8280-414f-bc73-5154461be31e","year":2017},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.560746Z"},"links":{"cited_paper":"/paper/1705.07269","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:b1a62caec5997ccdf24f7d4ecdcb9807a7d4b8a32065629784f1936b2a2bb4ed","observation_id":"6ad513da-4391-43df-bab6-67b1a63dfc25","resolution":{"observed_at":"2026-08-12T19:03:10.694077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-08-14T20:53:35.783079Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-12T19:03:10.563930Z","title":"Value-decomposition networks for cooperative multi-agent learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.563930Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:081a053eac76bca64b926573820ecf15b7f2ffa7ce6fcd269998c848f2bfbb8b","observation_id":"62c0ad27-6f49-4bfb-ab0a-8cace85207dd","resolution":{"observed_at":"2026-08-12T19:03:10.563930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.567010Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.567010Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:b06c4c8c4befe8153c96bedfe7a0e95f02359f30dc235eba57a011a9dcc2c250","observation_id":"da151567-1516-476d-86fe-e03a52b08055","resolution":{"observed_at":"2026-08-12T19:03:10.567010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.907902Z","title":"Overcoming model bias for robust offline deep reinforcement learning","venue":null,"work_id":"24f3e87c-fff4-4da1-b408-73cd4ede4d61","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.570496Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:7670428c22bea349812d243abcda4023d3cfa0264009aa3b26d4e59d8ae6fc68","observation_id":"b53450e0-fc4a-4d63-936e-84aac85b1e28","resolution":{"observed_at":"2026-08-12T19:03:10.912011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.895312Z","title":"Leveraging factored action spaces for efficient offline reinforcement learning in healthcare","venue":null,"work_id":"0f7ca1d0-36f3-4f99-a2ba-2f6f84240c20","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.573946Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:0d2ced7c63a1383c95031eb50324bea98e32b03b1ab443fe4f60dc8df1bc4e7e","observation_id":"b0afe93c-5661-49a1-b6ec-7a8452097a63","resolution":{"observed_at":"2026-08-12T19:03:10.899804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.884126Z","title":"Discretizing continuous action space for on-policy optimization","venue":null,"work_id":"bbf4be67-4e5e-4d02-9e52-a6fc4fb2b176","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.577735Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:d37b7293529c34c006443d5696c8764a99c07653c502f62e7dd8627868f09b76","observation_id":"89cd17e2-af62-49dc-ab1f-6809f85b6990","resolution":{"observed_at":"2026-08-12T19:03:10.888097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.582027Z","title":"Action branching architectures for deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.582027Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:98c7326091c6aa1fdd5bd51ba5b57e075246c10879c6c7eaad5dc8ccce07e623","observation_id":"dc881ed4-c489-40ff-9e92-e1fe405df76d","resolution":{"observed_at":"2026-08-12T19:03:10.582027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.866888Z","title":"Issues in using function approximation for reinforcement learning","venue":null,"work_id":"d25a4ba8-cb11-407e-9bfb-c2741c519ea4","year":1993},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.585574Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:dc42baade88ae1af1f30738353ae41bb6da809ffe413704d70869cf72c7df9f2","observation_id":"15eb96b7-e6a9-444e-8428-a1231c7cf863","resolution":{"observed_at":"2026-08-12T19:03:10.870116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.589045Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.589045Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:b054d646d5d01572a75d5255f68d6dcec9653ac7fa8bec8c39ddfefbb39f35df","observation_id":"4e45167d-b1ad-4371-a45d-8154233ba893","resolution":{"observed_at":"2026-08-12T19:03:10.589045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08116","last_updated":"2020-01-22T16:14:38Z","snapshot_observed_at":"2026-07-06T08:52:06.518581Z","submitted_at":"2020-01-22T16:14:38Z","title":"Q-Learning in enormous action spaces via amortized approximate maximization","version":1},"cited_work":{"arxiv_id":"2001.08116","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.08116","snapshot_observed_at":"2026-08-12T19:03:10.662169Z","title":"Q-Learning in enormous action spaces via amortized approximate maximization","venue":"cs.LG","work_id":"b0938a29-a206-4b14-bdc8-dd10d47c0b51","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.592385Z"},"links":{"cited_paper":"/paper/2001.08116","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:515a7a168a65f9f57cf251ede7511d6203dfdb69b63325335cd74291de8de0fb","observation_id":"3c9fd57c-a71e-4ee5-9efe-fdc4934ec6dd","resolution":{"observed_at":"2026-08-12T19:03:10.668174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-12T19:03:10.596540Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.596540Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:d7605ef2eed6e1f6b1fedb914951b3f4512d48926e834fbc5ffc8dd81dc0f827","observation_id":"48dd1f62-717e-45c1-bec5-08e23a57de46","resolution":{"observed_at":"2026-08-12T19:03:10.596540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.848650Z","title":"RORL : Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":"986b74e2-ee10-47b6-8297-8765c81c5c4b","year":2022},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.600207Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:44d4ae62ac6c02fda9b37054865ec3284ca4f37b309d5961983f02d6846e3aff","observation_id":"bf18b59d-b88f-48ce-ada5-e298676a5bd3","resolution":{"observed_at":"2026-08-12T19:03:10.852974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.836539Z","title":"Reinforcement learning in healthcare: A survey","venue":null,"work_id":"cb802ef2-a9b8-4d14-83fc-0dfe8c4e4c39","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.604130Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:683bf6aa8002c8fa18632cf0577bea57dcf204bb9abb221dc631bbcb6c6a47a8","observation_id":"7177f340-7afd-4c85-adfc-fbda40a250a6","resolution":{"observed_at":"2026-08-12T19:03:10.840494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.824766Z","title":"MOPO : Model-based offline policy optimization","venue":null,"work_id":"d8299a02-770e-4130-9afe-884c9d508f21","year":2020},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.608384Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:4a52d788d893d58aae623f0902d428973d39e5f9e0171fbcce991203495d771d","observation_id":"d5c1c604-2253-4a91-814f-4bba423b7656","resolution":{"observed_at":"2026-08-12T19:03:10.828752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.813148Z","title":"COMBO : Conservative offline model-based policy optimization","venue":null,"work_id":"2f6259c1-7c3a-4bd5-90ae-b9df4a69efac","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.612100Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:1529a43ed7d98d0a78d09ca199979c882bc23248bb709695af0099cc4d1780e9","observation_id":"68c1c6c0-0f34-4fc2-94bc-e14ec62c22e0","resolution":{"observed_at":"2026-08-12T19:03:10.817118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.801114Z","title":"Deep reinforcement learning for page-wise recommendations","venue":null,"work_id":"a18ea010-c0da-4237-b845-eac88a4a700b","year":2018},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.615617Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:704d4a82698b1e83a5a2d7827f0284320bf279a131c369e1574727e9474afdff","observation_id":"91331d7c-df83-4dd3-8aad-f7f0fa78d947","resolution":{"observed_at":"2026-08-12T19:03:10.805460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:03:10.789525Z","title":"PLAS : Latent action space for offline reinforcement learning","venue":null,"work_id":"15b4cc5f-1891-407a-bb36-f72cda9c9fb5","year":2021},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.619048Z"},"links":{"citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:baf7d5b7a7ae372990e3d71fa74f26148c541ad9f1bcb1f80e2334bc72f42f63","observation_id":"ba122343-154d-4eb4-838e-b2460cc18d8e","resolution":{"observed_at":"2026-08-12T19:03:10.793346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":50},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2411.11088."}