{"as_of":"2026-08-20T05:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4648e9e64458c419ea92666629f1d1751bc75245887d4dafa84ce61021bad5df","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:25:55.777412Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.07257/citation-record","integrity":"/paper/2505.07257/integrity","json":"/paper/2505.07257/citation-record.json","paper":"/paper/2505.07257"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.417996Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.417996Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:40f8f72b9d96d1c3f7c51cec6c6fccadecd4a5d4b39942eda4c363e4708e2801","observation_id":"9af7edd7-91e6-478e-bc86-629809174bce","resolution":{"observed_at":"2026-08-15T22:25:55.417996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.422838Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.422838Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:0ee6f437c1c6dfc1ac570c693f06dea2d51d5e6a94ad13c1a509705b6708bd13","observation_id":"9df4636c-890e-4f51-abd9-d7caa1e2535a","resolution":{"observed_at":"2026-08-15T22:25:55.422838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.427084Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.427084Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:d8b448a3887d48f04bc47261952bd1e3f0addd68d303713e3732dda97ec7e3e6","observation_id":"2816ada7-6208-4882-a0f1-e4ee9a06eec6","resolution":{"observed_at":"2026-08-15T22:25:55.427084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:57.008847Z","title":null,"venue":null,"work_id":"39ec3f81-ae42-4ead-ab8a-135d3accf4b5","year":2002},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.435699Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:36d2e9bec8999635eb3e8b54e6dd2e63c52c2e41f2a32e5f3bb82732b864754d","observation_id":"737e7eb7-7e2a-40b7-bcd7-d8245e6a1d00","resolution":{"observed_at":"2026-08-15T22:25:57.013350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.993569Z","title":null,"venue":null,"work_id":"56520efa-4235-46b8-a698-87f777d320fd","year":2008},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.439842Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:5d61012edcd479ed1ee2a2647e81902bf1ca9b7ce0caeb15de9fd032a30ac65d","observation_id":"3a334e44-0009-4c5f-95d2-34ca4b465d61","resolution":{"observed_at":"2026-08-15T22:25:56.997896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.978304Z","title":null,"venue":null,"work_id":"3ee38c29-c732-4905-88e8-46eee6ad63cf","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.444319Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:665696ee330a278bc2fa3368d1068f65f56e50ce3dcf24cef71973bcc6f49d68","observation_id":"9ed5cc3f-1da4-40a6-9f93-1b4b93df9376","resolution":{"observed_at":"2026-08-15T22:25:56.983169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.963861Z","title":null,"venue":null,"work_id":"f3eb5e4e-bdd7-417c-b852-4f98c6f9d74a","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.449213Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:f00b19045025e0559926a322ab7f2125aa133ac63c6a074fec72b057ca67c950","observation_id":"4daabc0d-8d16-4a70-aabe-80e4ecef414c","resolution":{"observed_at":"2026-08-15T22:25:56.968091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.949787Z","title":null,"venue":null,"work_id":"ce0dab9a-e6be-48cb-a3b1-5797cd4fca85","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.453505Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:21d552b9d8d198f9b05365fdf5a23a906feb336d2aed9ff0112e71cb1d8e42de","observation_id":"8501decf-fe9d-415f-83f6-30a9f1a7fbc3","resolution":{"observed_at":"2026-08-15T22:25:56.954060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.935243Z","title":null,"venue":null,"work_id":"0ff04505-46ba-455a-86b8-586ad51b8d00","year":2021},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.457603Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:170dde8e16c2a9d4dfc76020f7a0c2dbacfa03330b1eff36ba82900236c05a09","observation_id":"6fa14903-e011-4282-b7b1-7d58d8288995","resolution":{"observed_at":"2026-08-15T22:25:56.939736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.462622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.462622Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:2c23b2fc53d9d02df7372377e952d26bde1b33404855ad42460c9d9501d6e65e","observation_id":"8e3c0275-4003-42fd-8521-e0313e7e7096","resolution":{"observed_at":"2026-08-15T22:25:55.462622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.471113Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.471113Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:870ad9d589547103cb316f56ba56dd4fb21f187d7b91996fca59cc88845a6cdf","observation_id":"b4c9ea37-1f38-4ae4-a04e-0b8303b79f9e","resolution":{"observed_at":"2026-08-15T22:25:55.471113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.870479Z","title":null,"venue":null,"work_id":"ae9d6b67-2a5f-4dbb-9ec9-42e63231e032","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.479738Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:b89d648ea5c78781d103adc0779b9dfc1b20a831ce0e5a3491cfa94febdd493c","observation_id":"102a4e74-2a5f-4432-af5d-7e5f494efcb1","resolution":{"observed_at":"2026-08-15T22:25:56.875038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.856342Z","title":null,"venue":null,"work_id":"a3e93f96-50a9-48bb-8712-35a269358778","year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.484320Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:64b623209c8630df0ab125922e66ac2d4f590780f7d9925c0eb3cf206748f5db","observation_id":"94402505-0505-4702-ad6c-9d0cb35a5de4","resolution":{"observed_at":"2026-08-15T22:25:56.860540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.884608Z","title":null,"venue":null,"work_id":"9ee8b7bf-2024-4eec-a9e4-d413a913c9ba","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.475053Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:1e30b6e1d4f6f8e94ccd82864a76f1bd43ba6af7faa9a9508f511ee6a45aa35d","observation_id":"048dc28f-d23f-449c-83c9-e21688271393","resolution":{"observed_at":"2026-08-15T22:25:56.890736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.829161Z","title":null,"venue":null,"work_id":"f9e3902a-fbbb-42ec-8e26-e0fb08a4d476","year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.494110Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:964e26f2735dde70d9e7d20cffdd7d7a74fc7753490435574caaa268aaf37ff9","observation_id":"2c42cc6f-dc19-4911-ac9e-1043313871d8","resolution":{"observed_at":"2026-08-15T22:25:56.833511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.814879Z","title":null,"venue":null,"work_id":"8229dd6d-716a-407c-83e8-03ca46b9f596","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.505650Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:b77c51b712a830c7ba1259603f6ee3667b5b3174349a20c570ebc8c10bc2bf93","observation_id":"7e2ac726-057a-4428-9b45-e6f5629c755b","resolution":{"observed_at":"2026-08-15T22:25:56.819119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.842749Z","title":null,"venue":null,"work_id":"12ac9be4-e00e-4e28-bd08-0e0a52e2a38b","year":2018},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.489050Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:ab23c1637bb15b5933e746ac1fa5655e7de1ed30bc9fb42992fcfcfc346cc30e","observation_id":"c237c3e6-24c7-43aa-917b-6a5e99d8237b","resolution":{"observed_at":"2026-08-15T22:25:56.846913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.786939Z","title":null,"venue":null,"work_id":"54115436-8812-4deb-b8ab-5bb5a05ab48c","year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.515535Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:548b302a182209c56b29cccf2b412a489e72eebdfc042c9f2c213cbc7821907a","observation_id":"5e413d7b-16be-4658-9387-defe267a8403","resolution":{"observed_at":"2026-08-15T22:25:56.790940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.772805Z","title":null,"venue":null,"work_id":"a8626e1b-ebed-4b9a-a86c-44c017efc950","year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.520242Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:7464d4f362378a0015ff80645413072e745838eabf74dfff723383c2dbad592a","observation_id":"f8a6a409-7891-4898-9c85-5a436a85bd87","resolution":{"observed_at":"2026-08-15T22:25:56.777017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.758505Z","title":null,"venue":null,"work_id":"8dba6aa0-a7c9-4d05-a919-152573527bcf","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.525212Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:dbaf559676bdb25589e06a24cdf982bf4343611041e415b1f288d097c7550ec2","observation_id":"278e52bc-403c-446c-8a6b-e967b4a3de96","resolution":{"observed_at":"2026-08-15T22:25:56.762813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.801143Z","title":null,"venue":null,"work_id":"4ccb6e89-d990-4c9e-a76a-9159c3f7183c","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.511008Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:a386bc568395d4c01bc77c7954fd661af63cf0d4d45f3d2107a2e37180c0365b","observation_id":"ad69567f-da9e-4f41-afbb-beb27093b907","resolution":{"observed_at":"2026-08-15T22:25:56.805384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.729341Z","title":null,"venue":null,"work_id":"63d3f6bc-0b4f-4fa6-a727-f19e28ec4988","year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.535216Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:1d4f2a4f50d66c1f8316bfdd669754bdb950300eb251e70137af3d7e11bbb123","observation_id":"4d6cb956-b13c-4530-82b9-03eeed0e4634","resolution":{"observed_at":"2026-08-15T22:25:56.733674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.714332Z","title":null,"venue":null,"work_id":"18540f96-8064-4148-9a10-aaf82b36b131","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.540536Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:1c12064d5a8f66cbdc49f4af55f287598598cdffa9b17325e27736472fdb2e8b","observation_id":"fc7b8d68-f5ed-4865-af2e-52f131b8e88c","resolution":{"observed_at":"2026-08-15T22:25:56.718944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.699986Z","title":null,"venue":null,"work_id":"9cc54853-198b-418a-a4d7-2490f600339a","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.545167Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:612a83618f6b52f5ce0b6ae5da63d52ed1927c26a23344e1b43c6f51161f845c","observation_id":"b4df0f94-7274-462f-a2b4-b1c2417af1d8","resolution":{"observed_at":"2026-08-15T22:25:56.704203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.743389Z","title":null,"venue":null,"work_id":"2be04617-2ddc-4989-9260-df5770b32b0e","year":2017},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.530087Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:e04915e50c55e3592c18497699b7855bd8ea369db1ed9d492fbff09c7c05dbc2","observation_id":"fa3bcc53-3b97-4ef6-8a6b-a4f4edd714fb","resolution":{"observed_at":"2026-08-15T22:25:56.747796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.554540Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.554540Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:8d5750f398fd31c70775d7d7eb8ee0fe810bc2ac78d9dc79c0ab9bbdf21a91f7","observation_id":"ac1f5aaf-3003-4ea6-ba9e-1698dc4dc77a","resolution":{"observed_at":"2026-08-15T22:25:55.554540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.558374Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.558374Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:77c9325969b121edeeacb52e8e163cae44c26b0aea704b89e9126ccd0b5efefb","observation_id":"db6fe90d-aa72-4b9c-8f21-ef78cdd33f22","resolution":{"observed_at":"2026-08-15T22:25:55.558374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.637732Z","title":null,"venue":null,"work_id":"cdb0aefc-ea04-4d10-8478-37bd2d3f3319","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.567087Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:d48cc75d8331016372a2d5ee90f22fb86f22eead3eac329ddbafc79e223e2d46","observation_id":"b8388785-a0f8-4797-a147-34f227a3115f","resolution":{"observed_at":"2026-08-15T22:25:56.641780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.685858Z","title":null,"venue":null,"work_id":"ae388eae-dc15-4698-b40e-a979908b7d76","year":2024},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.550344Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:d42a3aff1cc50295064a7b9827fc9ad7f3e1ced4e8735d86f24902ba03395d19","observation_id":"1189e02e-097c-4dbf-8eaf-90932a23b0e1","resolution":{"observed_at":"2026-08-15T22:25:56.690298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.610181Z","title":null,"venue":null,"work_id":"be45ca7d-010c-4d03-b2f8-6f578d982341","year":1985},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.575308Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:f18578bba8518fad1fac51df4228f51048be8c615b67b56ea2d5671723a9dd97","observation_id":"c9b17814-851c-4c51-b5f2-eb1ac0892e02","resolution":{"observed_at":"2026-08-15T22:25:56.614607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T22:25:55.579286Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.579286Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:4b2f16cfdcedfcf2a38be7b21bedba9f848a5777e5651543520d9ea8da2fca03","observation_id":"78798685-335c-430b-9297-39c7ac568d8e","resolution":{"observed_at":"2026-08-15T22:25:55.579286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.651628Z","title":"InNeurIPS","venue":null,"work_id":"d69f3ab5-ed84-4753-af2e-196afc4b2d2e","year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.562612Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:41ce9895e7f037100a3b362aa4add049b364ab2007175002b17d0c5b19cf431a","observation_id":"0f0e2147-90ba-4c47-914d-b852e245808c","resolution":{"observed_at":"2026-08-15T22:25:56.656004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.563935Z","title":null,"venue":null,"work_id":"5e88e6e7-b85e-4de9-b1a6-adbc96a4b2ad","year":2024},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.587934Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:3d62544b3649e5088f3ae213c266514d1bedcf5175f0ab9eb43904b563cf0a20","observation_id":"99e30ff1-0d84-4e2f-9cff-610395ee73db","resolution":{"observed_at":"2026-08-15T22:25:56.572376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.624499Z","title":null,"venue":null,"work_id":"7387f513-c6e7-4076-9300-767f897e77fd","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.570947Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:43ee25765b55c8c8576560b08c6c030157ef73ada809c654035183da5b3c2e61","observation_id":"4b4cfa8b-c194-4b82-b4a0-6a4ff4181085","resolution":{"observed_at":"2026-08-15T22:25:56.628474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.511575Z","title":null,"venue":null,"work_id":"390cdef6-970f-45a0-a507-df1ab87f32af","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.595805Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:13bdcb888da12a2fbfdf49d128f2d3884e14e3ca4a5713ddd32180d15c7da4e7","observation_id":"837a1aeb-89e6-46c2-b886-5deabee590f8","resolution":{"observed_at":"2026-08-15T22:25:56.522258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.489513Z","title":null,"venue":null,"work_id":"6dd04770-f089-4f59-a45f-f4760b7a9e12","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.599783Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:0ccf01d408192463e1f6021f330f90ec8e372076262bb1a1a9373a987af0deee","observation_id":"c35fb749-3a0a-451c-8f8a-f5bf63ee2f06","resolution":{"observed_at":"2026-08-15T22:25:56.496816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.587523Z","title":null,"venue":null,"work_id":"cc943c03-a5ad-4c86-a446-86da67f59a9c","year":2021},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.583788Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:b3301c25308c5db3be2bcba8bc99dc5f3c1d85ed90e709ceb8f18a6325985a61","observation_id":"70b8473a-7e9b-4f04-95a7-53a160ea0f37","resolution":{"observed_at":"2026-08-15T22:25:56.596111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.455417Z","title":null,"venue":null,"work_id":"6e67bc14-fac1-406c-b54c-43dab076e2c8","year":2016},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.607600Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:6f8c560ebaddfc36717349fc30c0930460f03781fff0eae4760c9f0ddabb8f1c","observation_id":"2fcf0cd7-d2c8-4447-86c1-b534328b86bc","resolution":{"observed_at":"2026-08-15T22:25:56.461278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.539275Z","title":null,"venue":null,"work_id":"952e5b2c-a27e-4488-bebc-f6b33f6a61fe","year":2017},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.591944Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:101e526c70631002868a1c91181daa59dab64d2326c677de2106305e0da865ef","observation_id":"0f513c83-e498-412f-846c-ad9e2d91ce06","resolution":{"observed_at":"2026-08-15T22:25:56.548883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.615421Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.615421Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:761af5125b17620095f34cd0030bce9a4ad27abe78f03f414924aa12f808cd50","observation_id":"dd1b0354-2abe-488d-a851-c2f01b9c5737","resolution":{"observed_at":"2026-08-15T22:25:55.615421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.396500Z","title":null,"venue":null,"work_id":"4889bb5e-ffce-431f-9057-c20726f9e741","year":2021},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.622922Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:ae8991796c25f8be4b8d32cc4ba7c3e8d6635e294d1a47be2977784824db4e32","observation_id":"13c51141-fb4c-43b1-b0b3-48034ccd4115","resolution":{"observed_at":"2026-08-15T22:25:56.401280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.472717Z","title":null,"venue":null,"work_id":"87fcf199-49d0-4df6-b150-c04aa46ff9e8","year":2009},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.603776Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:6a1c0de189a64d9a76348e549a8e532fefbb73f0c1b05aea93beee3523240d5e","observation_id":"fc747e0f-3bc3-4c57-9673-f4afb9954f1e","resolution":{"observed_at":"2026-08-15T22:25:56.478320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.364897Z","title":null,"venue":null,"work_id":"7b95c9af-2423-42b2-aca1-0eca597364d8","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.630445Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:05416d7025957f065ddab30dc87d583b30466411e2dd4d83c94a9152a57a01fe","observation_id":"f27b91cc-b0ec-401b-8e03-c67b8bea9ccd","resolution":{"observed_at":"2026-08-15T22:25:56.369675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.439040Z","title":null,"venue":null,"work_id":"480074ae-0b85-42b8-a9c0-36aa94772a29","year":2021},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.611426Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:f5c52021827cc479389c79fdd16116f2684e1aca265c3c4aec28254ad1f4f8ff","observation_id":"28830c6d-f3f7-4713-b35b-238a9f8cdd97","resolution":{"observed_at":"2026-08-15T22:25:56.444314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.333318Z","title":null,"venue":null,"work_id":"c1d48977-5f89-425f-9f37-9a348ee09527","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.638775Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:4149b9763d214ca7f31789d329940a35ca2be9aa2566e9c4afad8f88cc4c8048","observation_id":"79a97c3b-7a4b-4a78-a69a-be3ca859c02d","resolution":{"observed_at":"2026-08-15T22:25:56.337883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.411895Z","title":null,"venue":null,"work_id":"df781391-bbd4-4bca-aa13-e83ed14c3562","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.619116Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:cf23fb61900f9f9b3cef2ad685c3fa953fae97081b111a875797349106ed5c9d","observation_id":"b5341104-dcc8-4493-8357-57911ab05e7f","resolution":{"observed_at":"2026-08-15T22:25:56.416942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.303567Z","title":null,"venue":null,"work_id":"75c75910-994b-471c-bc42-c90d1438f635","year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.647171Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:b4c580e71a188eabb9ed15a8af519f5616e23fd20b6f3b69cf94cadcfc6a41d7","observation_id":"3c27727a-8ac9-4147-a465-4072f75a32f3","resolution":{"observed_at":"2026-08-15T22:25:56.308158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.380401Z","title":null,"venue":null,"work_id":"ab04fc47-1757-4079-ad97-3d83033a6a50","year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.626668Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:2209fe3b522487679aea9065538633faa6225e7c3be905a4be9d4f1ba06eb808","observation_id":"1dc52960-8b9a-4c54-8cc0-75576a5c9fee","resolution":{"observed_at":"2026-08-15T22:25:56.385753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.272637Z","title":null,"venue":null,"work_id":"a6b47156-02a1-4713-a0b0-72cc3bfc09cb","year":2022},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.656421Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:8a3a0baf5c2dc1a646c3a44b4995f108f9278f0519a0d8722c5414833edd6a73","observation_id":"fe164e63-9627-40ce-829d-7563409f05cd","resolution":{"observed_at":"2026-08-15T22:25:56.277043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.349118Z","title":null,"venue":null,"work_id":"7c0eebf5-f0e1-4366-ae17-ff44a630825d","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.634593Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:d6e987b1cb4ae14ac3ac569db561e0838519415f1eea7db4b09def58fedbb5f0","observation_id":"b773f395-308a-4192-aa20-d3255124aac4","resolution":{"observed_at":"2026-08-15T22:25:56.354075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.665591Z","title":"2018.Reinforcement learning: An intro- duction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.665591Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:a28fa89866934361df1eb47540104042ebd508c25641d38b160a95fa8dabb12f","observation_id":"eb569d3c-7551-4a5c-8c96-4fe3ff3634e5","resolution":{"observed_at":"2026-08-15T22:25:55.665591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.318195Z","title":null,"venue":null,"work_id":"ce924a8c-24d5-45bb-acf2-60d6001fe692","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.642653Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:7c47e1bb788060eb9382441e29d620bfd80581d94686db3fcd9d43f98feebcc3","observation_id":"05bb752e-ca89-496d-950c-e354c5768f6c","resolution":{"observed_at":"2026-08-15T22:25:56.322822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.674503Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.674503Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:501381b5af1566a53d72dc8cf56ade0365e755003d0eb86f2af85d40de7d1317","observation_id":"e4aa578a-142b-4949-b66c-987f623a3041","resolution":{"observed_at":"2026-08-15T22:25:55.674503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.287981Z","title":null,"venue":null,"work_id":"265bf0f8-52a1-48cb-8754-342d77404831","year":2016},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.651628Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:401d92f72cb46e25f708c3f08ef2df90ae5f042225583434c1357e4f8d1b266a","observation_id":"626fb8d1-f43d-496e-b998-41cbd4814b95","resolution":{"observed_at":"2026-08-15T22:25:56.292770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.191087Z","title":null,"venue":null,"work_id":"76ee33df-c46d-43b7-9659-765c1ddb1f95","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.683795Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:d198115cdbeb54deb98849ab44d4466332b01535d02624133921a08a0082675e","observation_id":"2df86221-5c4a-479d-9e3b-a79c5001c873","resolution":{"observed_at":"2026-08-15T22:25:56.195337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.258053Z","title":null,"venue":null,"work_id":"20a42f63-6ce4-48a4-9742-2807658119ff","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.660769Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:836b6f98aabb6f49a051de343701ea710119f1b3b7531f54eee7c68a8f9fb757","observation_id":"ccacb745-fb58-46ef-bce5-508f7c39e161","resolution":{"observed_at":"2026-08-15T22:25:56.262231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.161572Z","title":null,"venue":null,"work_id":"955f8341-cf97-4610-a2aa-fedc2d648d56","year":2025},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.693672Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:1512c8c02d15e04199890bcad747dff56e3a9da6ddcb4bc8f31c134d36b9f63f","observation_id":"6d8549a8-828b-41fe-adfa-3396591de5c0","resolution":{"observed_at":"2026-08-15T22:25:56.166386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.231142Z","title":null,"venue":null,"work_id":"09e5ac31-5901-4e89-8439-90ec6a4fe1d3","year":2015},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.670188Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:cc7d749ab00b4cf4d21806512d0ab93f163498a26cc1dbf71fa517565eb9ad5d","observation_id":"933e3875-3ab5-4e59-9bb4-df9aa222a65f","resolution":{"observed_at":"2026-08-15T22:25:56.235964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.129019Z","title":null,"venue":null,"work_id":"19d147f3-532a-41c2-9f8b-cf65a8ec3a1d","year":2024},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.702521Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:13720e518924cbba386d8b872f6774edb2c37ae19c42da5530c26145b7c15474","observation_id":"f98b874e-de3c-4ac5-b484-c856a70505c4","resolution":{"observed_at":"2026-08-15T22:25:56.134118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.205221Z","title":null,"venue":null,"work_id":"8aff6d5c-27de-404f-b572-2ddc3d9fa1c4","year":2024},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.678993Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:e7fd80c7b8e83850eb7a0a17b5c4c432ca1eeecc602e307e4bbd89639df39cb9","observation_id":"b555f2a9-b572-43c3-970a-ba8bf3a3c44b","resolution":{"observed_at":"2026-08-15T22:25:56.209663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.097668Z","title":null,"venue":null,"work_id":"31fdccb1-00ca-43af-88e1-d193e957b95c","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.711452Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:199a28d71379ce6c58768e665e11cb74192fe32e9b855115425397a5416cb77a","observation_id":"b29034e8-191b-4d02-9db8-f8d63649bcd8","resolution":{"observed_at":"2026-08-15T22:25:56.102867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.177053Z","title":"Foster, and Sham M","venue":null,"work_id":"3490e039-2da5-48e4-8299-1f1a5650c0ff","year":2021},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.688616Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:838a5de884dc131edf950f65afa736a2f7ac31285d580940b92a9e7efc237871","observation_id":"c9bfed1c-cc5f-4f5d-a868-35a6bc94582d","resolution":{"observed_at":"2026-08-15T22:25:56.181344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.067866Z","title":null,"venue":null,"work_id":"0fc6a33c-793d-4af4-ae73-1cd9e5fdcf2f","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.720426Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:6156ae5480fa4e3e16e65ed129f0dceabaf2936ab75b1460a2bcb8777956f1ec","observation_id":"503d55cd-3701-44b6-b361-ea29e7038d01","resolution":{"observed_at":"2026-08-15T22:25:56.072185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.145727Z","title":null,"venue":null,"work_id":"3ba71b1f-f068-4421-a6cf-b12a4cf40f7f","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.698134Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:7dca89b2cc450b36f7b237862aa9263cf59bc85a27d99f8e00efdbc5ee19199c","observation_id":"be4ffc61-2be4-481a-bb35-c58249393d80","resolution":{"observed_at":"2026-08-15T22:25:56.150950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.032123Z","title":null,"venue":null,"work_id":"46b12aa6-06cb-46f9-bc9a-88f957e67e35","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.728268Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:447f1199e62bf57017fb77559c6731bb226dac5d77ef22d81593e391b9d4ee84","observation_id":"f8adbd49-39ec-42c4-a60b-edd9749f0618","resolution":{"observed_at":"2026-08-15T22:25:56.038538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.113576Z","title":null,"venue":null,"work_id":"981343df-3fdf-4941-b22f-9548aa447038","year":1992},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.706941Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:19214038715a4d7c4a011c157f372e0c6c234b8e6ec8e8d11429dd6d7b8f67bc","observation_id":"fd353c0c-ff80-4416-a4e3-1e7a59b96426","resolution":{"observed_at":"2026-08-15T22:25:56.118559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.000961Z","title":null,"venue":null,"work_id":"c9ea1bb2-86e8-4d43-b334-8bf24a3d9d34","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.736150Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:3d726f1220eed7506e3eb595853fc941d07f95b83804412d6f8847cab4f10619","observation_id":"a4374411-af8f-4615-adb2-75c67c98b4ed","resolution":{"observed_at":"2026-08-15T22:25:56.006743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.082407Z","title":null,"venue":null,"work_id":"be7cfa0e-50a8-4a77-a7a4-e0003eca2d2d","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.715678Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:bd989c3fa91b7baab9cfc571ef6a5cdb3a1f5786c961f90fc58a0de15b96ecdf","observation_id":"0840d174-1537-46a3-8688-c938dd1fba91","resolution":{"observed_at":"2026-08-15T22:25:56.087396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.963139Z","title":null,"venue":null,"work_id":"0bfcb66c-facd-4cbb-826d-4124a73b7dd2","year":2019},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.748601Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:28004b1f40069c835daba22e06df232f8fdd0232fc0a995f44140dd41c78aff0","observation_id":"ef2ef2c2-aa46-4bae-bece-833a612c0c2d","resolution":{"observed_at":"2026-08-15T22:25:55.968454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.050684Z","title":null,"venue":null,"work_id":"b70bb5c4-32d9-4561-bc49-dacb86167bf2","year":2021},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.724233Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:d30761284e1c68bc9d2e1ef5cb3fe8fa685c0d51085f3bc2846ecac2f916e9e9","observation_id":"53c2ae9a-8c9b-47fc-bfa4-86bfbc415104","resolution":{"observed_at":"2026-08-15T22:25:56.056237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.930314Z","title":null,"venue":null,"work_id":"3db89cc0-3d27-4140-beb7-3ce84196c6ee","year":2017},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.756825Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:24389dea354dc7afd10fb52141afa7e7288e302ed16b5269228571f8a6f28aef","observation_id":"ae4c6388-41e5-4b38-8b60-b1b093c682c4","resolution":{"observed_at":"2026-08-15T22:25:55.935452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.017176Z","title":null,"venue":null,"work_id":"1a76d684-18e6-4a39-9405-2747d34e9677","year":2024},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.732141Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:fe11ff16cb57b5880b041dd3919de2bb8e244063a0f535ac53d1f56ce84b7632","observation_id":"e920fd7f-c0a8-4953-a43e-449a8d0fbbbe","resolution":{"observed_at":"2026-08-15T22:25:56.021483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.898297Z","title":null,"venue":null,"work_id":"0e637be4-50a2-46e5-9c7c-b7acfdede9ff","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.765394Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:012edb1c0a5e0015b86cf02357b59f3e92726881494760da61d61cd55b3161fd","observation_id":"745ce9a6-b4ad-4ed2-92b6-4fd87812f160","resolution":{"observed_at":"2026-08-15T22:25:55.903013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.981278Z","title":null,"venue":null,"work_id":"c07d1630-da44-4a32-9a2e-a9e6b94c4bba","year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.740037Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:fbfa95deb4ce6aaacf2b2f46a410ced16ae562b1bd144ab233d1e16a629f9687","observation_id":"2e7eaa71-c9ac-4b77-9990-bf1794a86a66","resolution":{"observed_at":"2026-08-15T22:25:55.986727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04528","last_updated":"2024-11-11T17:30:55Z","snapshot_observed_at":"2026-08-16T14:36:44.881453Z","submitted_at":"2023-12-07T18:46:50Z","title":"Using Large Language Models for Hyperparameter Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04528","snapshot_observed_at":"2026-08-15T22:25:55.744219Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.744219Z"},"links":{"cited_paper":"/paper/2312.04528","citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:39682358091a565c17b21d0d604d374f227d1168c9eb3d3c203f5ef9f006dfe7","observation_id":"125b57df-0cf4-4a04-b595-f359f6581a4a","resolution":{"observed_at":"2026-08-15T22:25:55.744219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.946586Z","title":null,"venue":null,"work_id":"72a58fe0-66bc-41dc-9573-5cf359635b57","year":2024},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.752910Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:35ee432c6454d110c791693f6721c38d2ac3c79d20d29a6ead76c876ec28f856","observation_id":"667f15de-7fb9-4f2c-8538-fbf72f01db21","resolution":{"observed_at":"2026-08-15T22:25:55.951775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.914778Z","title":null,"venue":null,"work_id":"260108b4-4fb2-47d0-9ddb-cfd108ef0e10","year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.760902Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:f56c262af971671f3cc4c4377a20902286311d5795ea23dff4ae6cb6339b5941","observation_id":"61cff8cf-ffb1-4b6a-ba39-52a780ac3215","resolution":{"observed_at":"2026-08-15T22:25:55.919826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.769458Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.769458Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:e1d52d90f89350e7f51ef9c8788c873411bc5b1f9fba64589e2c2e8eabdfa0d5","observation_id":"7ad323d4-dd5c-48eb-96a2-af37155c29ef","resolution":{"observed_at":"2026-08-15T22:25:55.769458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.873553Z","title":"InSIGKDD","venue":null,"work_id":"e5faadba-4bc3-4e70-b6d9-f7f2bdbcf2a3","year":null},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.773444Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:a8456542ea1260d54df8c4f7bb2a4fe654000f38a59acd2e86b898f0e7199cae","observation_id":"20517555-6330-406c-af3b-70e2a1a6935d","resolution":{"observed_at":"2026-08-15T22:25:55.877997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:55.857722Z","title":null,"venue":null,"work_id":"84bbc18d-99e1-454a-8986-908d0a988edf","year":2024},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.777412Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:a6e1e1121f7eb61567f0f29ea33e81560b4f018666d10f93232f007e4c8d24b8","observation_id":"e2f44424-0deb-4164-a374-123792cf24cd","resolution":{"observed_at":"2026-08-15T22:25:55.863357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:57.023406Z","title":null,"venue":null,"work_id":"1134883f-4077-4409-892b-b8f65dd65929","year":2013},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.431289Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:39ab4948ff3df1870ef46141528d278f7dda1f4945d83dc5b0d8ec30601611df","observation_id":"aad1cfcf-05e4-4b4b-bf29-a2a1c69fd5a2","resolution":{"observed_at":"2026-08-15T22:25:57.027646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-15T22:25:55.499070Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.499070Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:2585549f1a78af7964accc803af4fa3f605a9b5b27046152ed4344f76698eaab","observation_id":"3f780a0b-d543-43bb-94ee-cb09a9b7cfbb","resolution":{"observed_at":"2026-08-15T22:25:55.499070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:25:56.911455Z","title":null,"venue":null,"work_id":"ab27d2b2-512f-48da-91f4-55ac4f1c5dc3","year":2023},"citing_paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:55.466882Z"},"links":{"citing_paper":"/paper/2505.07257"},"observation_digest":"sha256:e3ca047764ad9a5e1dcfca827d1aa49bf772d716da7a4022635239982ffbfeb3","observation_id":"c9ac26d9-6f3a-432c-b369-ad5c703637ec","resolution":{"observed_at":"2026-08-15T22:25:56.915743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.07257","last_updated":"2025-05-12T06:18:31Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-15T22:19:04.137948Z","submitted_at":"2025-05-12T06:18:31Z","title":"DARLR: Dual-Agent Offline Reinforcement Learning for Recommender Systems with Dynamic Reward"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2505.07257."}