{"as_of":"2026-08-08T14:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fd651907f4055aaf78fccf74b53fd6e935a5799235493acac0eb0362b87e37c","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:06:32.504261Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21274/citation-record","integrity":"/paper/2507.21274/integrity","json":"/paper/2507.21274/citation-record.json","paper":"/paper/2507.21274"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.270530Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.270530Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:71e94acfb502b5b8d6cbb27e0d154513567f4407f3234f776c49b062cda5f60e","observation_id":"9527e20e-14bb-4f47-890d-93febf486a30","resolution":{"observed_at":"2026-08-06T13:06:32.270530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.283632Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.283632Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:31dc1a472ffc530ef65bf370d8ad3302e826f477003f0d7778f1d189be544070","observation_id":"31fce3d4-00b5-477b-a939-fa271ee711c5","resolution":{"observed_at":"2026-08-06T13:06:32.283632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.219613Z","title":"Tallrec: An effective and efficient tuning framework to align large language model with recommendation","venue":null,"work_id":"88f2a52f-195a-466f-a419-e9f7f3d72d08","year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.289399Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:520640666e72254754255db432d77c30821db670852b0a994d83f03dba139c41","observation_id":"6cf12dc9-72f4-42f0-b329-8c7c7fafc310","resolution":{"observed_at":"2026-08-06T13:06:33.224678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.200504Z","title":"Adversarial model for offline reinforcement learning","venue":null,"work_id":"a7f27caf-510d-4f58-98d2-e0f5142818ba","year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.298008Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:d233e30a0c0c357f03d891e731d3b60e90e745d2b4cb8eb095d166607c8035a1","observation_id":"86ea9218-6a7d-4a89-b1ee-fe433c9d6f35","resolution":{"observed_at":"2026-08-06T13:06:33.206275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.183862Z","title":"Stochastic approximation with two time scales","venue":null,"work_id":"362259f4-66ad-412b-bc7d-27d685cfc634","year":1997},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.304396Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:4c9e1a2c456cdf46ee79f18676a996a50dac4190588438d6e3b09fff32a3818c","observation_id":"c39dd834-a376-4763-9a45-3242aab78d80","resolution":{"observed_at":"2026-08-06T13:06:33.188871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16376","last_updated":"2023-07-31T02:48:56Z","snapshot_observed_at":"2026-07-06T16:00:29.832559Z","submitted_at":"2023-07-31T02:48:56Z","title":"When Large Language Models Meet Personalization: Perspectives of Challenges and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16376","snapshot_observed_at":"2026-08-06T13:06:32.314209Z","title":"When large language models meet personalization: Perspectives of challenges and opportunities.arXiv preprint arXiv:2307.16376, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.314209Z"},"links":{"cited_paper":"/paper/2307.16376","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:43449d9e416eedb4ff6837d0f5e9aa2f8d2827784f36dd9a1e15a42c8a500443","observation_id":"a7b8571b-43b6-4aff-b1c8-3a6987727fee","resolution":{"observed_at":"2026-08-06T13:06:32.314209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.165939Z","title":"Adversarially trained actor critic for offline reinforcement learning","venue":null,"work_id":"926c4295-2101-41ca-8243-365f9df6901a","year":2022},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.321400Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:6fa8dde7459498caf66e5b573b23f0c0dd27d5414c51261766354d821c3b135f","observation_id":"2fe45c2c-ab35-4408-b387-13fb4afe38b6","resolution":{"observed_at":"2026-08-06T13:06:33.171035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1259","last_updated":"2014-10-07T18:08:30Z","snapshot_observed_at":"2026-07-06T03:53:24.366023Z","submitted_at":"2014-09-03T21:03:41Z","title":"On the Properties of Neural Machine Translation: Encoder-Decoder Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1259","snapshot_observed_at":"2026-08-06T13:06:32.326866Z","title":"On the properties of neural machine translation: Encoder-decoder approaches","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.326866Z"},"links":{"cited_paper":"/paper/1409.1259","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:07470984879131901239e5c0bd842f1f5c39f8b7460c5f0354fb090d21bfdb2b","observation_id":"235ee978-ba42-4412-b5bf-4161837b600c","resolution":{"observed_at":"2026-08-06T13:06:32.326866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.151079Z","title":"A review of modern recommender systems using generative models (gen-recsys)","venue":null,"work_id":"aa380e47-e993-4ce5-82d2-8ffe4f1fd788","year":2024},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.335538Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:6dcb16fe70a0839241e5528125038b962eae6ead05d40d849fcb3560d4658b1e","observation_id":"631a51b8-7791-4f5e-b835-bf11c20585b5","resolution":{"observed_at":"2026-08-06T13:06:33.155646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T13:06:32.341879Z","title":"Bert: Pre- training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.341879Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:59961caac5818b932727f814263692cd78b6f5bbe83f1a741ff0882547d0bb6d","observation_id":"ead6fcdf-e467-46ea-ae23-9cd1aded9f74","resolution":{"observed_at":"2026-08-06T13:06:32.341879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02046","last_updated":"2024-04-29T09:06:51Z","snapshot_observed_at":"2026-08-07T00:54:27.770577Z","submitted_at":"2023-07-05T06:03:40Z","title":"Recommender Systems in the Era of Large Language Models (LLMs)","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02046","snapshot_observed_at":"2026-08-06T13:06:32.347874Z","title":"Recommender systems in the era of large language models (llms)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.347874Z"},"links":{"cited_paper":"/paper/2307.02046","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:bf0f20b3a80010388fd6145554fd857280e79fe7dc1bfa069431db04b5c67c0c","observation_id":"9efe23b4-678d-427b-b898-80ecc37f7feb","resolution":{"observed_at":"2026-08-06T13:06:32.347874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.135263Z","title":"Addressing function approxi- mation error in actor-critic methods","venue":null,"work_id":"b5bf5c5f-c084-400e-a9ca-4b8a4a741fe0","year":2018},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.363650Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:5f0fc52ebdb7d526774b0b189069cf61ffeb84c060a4143607b637576dc7f1af","observation_id":"d4bc672e-c5d1-43b7-bafe-1f786eff552b","resolution":{"observed_at":"2026-08-06T13:06:33.140090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.117178Z","title":"Soft actor- critic: Off-policy maximum entropy deep reinforcement learning with a stochas- tic actor","venue":null,"work_id":"e17b0a2b-a906-4834-942f-04e3f27b613c","year":2018},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.369523Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:f538371e404e47744abba8f5e4fc44835834ec535d752d26ef8abe78233e7902","observation_id":"8510f530-5fd6-422b-8d3e-cf9fd20045bd","resolution":{"observed_at":"2026-08-06T13:06:33.122823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.101140Z","title":"Maxwell Harper and Joseph A","venue":null,"work_id":"e7a9270d-3749-462b-a78d-1d076d2eae1b","year":2015},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.376998Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:78320046607644213b1823900caa58bd5fb9e07ee540e756b78dd2f395db1090","observation_id":"ab507f5d-99fd-42ba-992a-c16053591d26","resolution":{"observed_at":"2026-08-06T13:06:33.106299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.083217Z","title":"Large lan- guage models as zero-shot conversational recommenders","venue":null,"work_id":"08689a57-1530-4e09-a732-4a5b419be5df","year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.381848Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:eb24427ef00d219c1fe99b7d5ba2ddc58112cead34c1b51e440322d616575dd2","observation_id":"c7d85c18-6e52-439e-b37e-2632fd564f0a","resolution":{"observed_at":"2026-08-06T13:06:33.088042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06939","last_updated":"2016-03-29T14:52:58Z","snapshot_observed_at":"2026-07-31T19:00:00.136727Z","submitted_at":"2015-11-21T23:42:59Z","title":"Session-based Recommendations with Recurrent Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06939","snapshot_observed_at":"2026-08-06T13:06:32.387219Z","title":"Session-based recommendations with recurrent neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.387219Z"},"links":{"cited_paper":"/paper/1511.06939","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:148f681e29f9d5edb4698767b72fa8b988733143d9a32f39cdf714477f8b90c4","observation_id":"76edea6e-06dc-44e9-8ad0-8bf3260464d8","resolution":{"observed_at":"2026-08-06T13:06:32.387219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.064415Z","title":"Towards universal sequence representation learning for recommender systems","venue":null,"work_id":"c4054c90-4ad7-4205-92bb-80aa26b01ef4","year":2022},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.394208Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:ddadff7b97e8294f67cccad7323c46235958ce6a177bc806d7d1aa6a887d8c5c","observation_id":"44a34131-597b-490d-a7c3-db8d9ab19b74","resolution":{"observed_at":"2026-08-06T13:06:33.070053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T13:06:32.399332Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.399332Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:e00177ce392a1a6fe5d1b134188db6d9e0bf20bbd78a4e53c6a7c94f0a101b21","observation_id":"2b46a6e7-e9f2-4988-968a-1200f7ca45dc","resolution":{"observed_at":"2026-08-06T13:06:32.399332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.044263Z","title":"Human-centric dialog training via offline reinforcement learning","venue":null,"work_id":"5f51fba0-f24b-42c5-b670-dd16e628d02f","year":2020},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.405283Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:bd55d5c21bba055458222eec469165cf7d765ccb59c6d0b90dd7e24b6bcad6b1","observation_id":"b2bf7143-86ce-49bc-ae97-f31aca2c4e00","resolution":{"observed_at":"2026-08-06T13:06:33.049119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.028415Z","title":"Cumulated gain-based evaluation of ir techniques","venue":null,"work_id":"da8d05cf-a16e-4560-b4ff-68b6daedc87d","year":2002},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.413787Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:8efc65670d031e4d61a934b477894ca7ea501b558c9e7432de282b5e7813e577","observation_id":"b2791e8f-824f-4d4b-9c64-2545aa38da62","resolution":{"observed_at":"2026-08-06T13:06:33.033601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:33.010856Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"15a7d0dc-341f-4eb2-b9d8-e120b99777a7","year":2015},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.420117Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:6d7cd24c673fd1a9b025d1f2e0b52082f7f5f973e5e41e29c352e3267252247a","observation_id":"40441afe-eff5-4cbe-9117-4ad73561fa0f","resolution":{"observed_at":"2026-08-06T13:06:33.016934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05817","last_updated":"2024-07-09T13:17:52Z","snapshot_observed_at":"2026-08-05T03:33:18.005396Z","submitted_at":"2023-06-09T11:31:50Z","title":"How Can Recommender Systems Benefit from Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05817","snapshot_observed_at":"2026-08-06T13:06:32.425492Z","title":"How can recommender systems benefit from large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.425492Z"},"links":{"cited_paper":"/paper/2306.05817","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:e83e8718d5054c9a6ad1ad7a394f67f7f162809abdac78116a415fc5281323a8","observation_id":"d9bb156e-7077-4a25-b77e-4046b99350b9","resolution":{"observed_at":"2026-08-06T13:06:32.425492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.992577Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","venue":null,"work_id":"84763ac6-4f7c-448d-90d8-dc2300e0f29e","year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.430643Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:226084c339d21a4fa1f88d2d1b8961134d664fecda216c42db007b7d2434219e","observation_id":"0aa9d40c-b56d-47cb-b921-156523c8a3a5","resolution":{"observed_at":"2026-08-06T13:06:32.997853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.975574Z","title":"Diversity-promoting deep reinforcement learning for interactive recommendation","venue":null,"work_id":"d895bfb0-5167-4a74-b49a-f7d35468f619","year":2022},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.436766Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:988a377d18c2e010c738961f950a466df06b773a2b554c1c55c44886c01e4530","observation_id":"3c55693a-53a4-4bff-a68f-1f4d78cc7583","resolution":{"observed_at":"2026-08-06T13:06:32.980680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.957170Z","title":"Convergent temporal-difference learning with arbitrary smooth function approximation","venue":null,"work_id":"c09a5f68-1908-46dd-8a1f-632042a75576","year":2009},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.442735Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:e4d40d646cb7e6567cbada9c8528b20f34983fe07c91e1cd6424e6ca71b331b2","observation_id":"7a19ab21-727d-43e0-912d-dc2aefe06833","resolution":{"observed_at":"2026-08-06T13:06:32.962113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.939041Z","title":"Recent advances in natural language processing via large pre-trained language models: A survey","venue":null,"work_id":"974c2fe3-c16d-4e87-98ae-15c32aae6b27","year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.447719Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:971aa66ab20566df5c773bb77302d087a2ba1e6fe8490d338d26988c423b848a","observation_id":"557e0e8c-9c13-45e2-bb4d-54bb07b0ebd7","resolution":{"observed_at":"2026-08-06T13:06:32.944386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.921024Z","title":"Training language models to follow instructions with human feedback.Advances in Neural Information Processing Systems , 35:27730–27744, 2022","venue":null,"work_id":"6bf1e3ee-af48-4f98-96ca-c575cdfbd890","year":2022},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.453217Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:58f9c1516cc288073e42cb058c1efe380b3ddd04ec3afe2e0877a7017fc83ee2","observation_id":"1254bda8-8018-46c8-a2a2-f9a3e33fc42c","resolution":{"observed_at":"2026-08-06T13:06:32.926015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T13:06:32.458374Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.458374Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:ced5ac159bbf71fffff15aba85ec331c90d86464f2d85749579681e8faf7e176","observation_id":"c5381e4b-f6c2-4ae3-bc1a-c2fbe106b12e","resolution":{"observed_at":"2026-08-06T13:06:32.458374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.903816Z","title":"Choosing the best of both worlds: Diverse and novel recom- mendations through multi-objective reinforcement learning","venue":null,"work_id":"a1e2f62b-aa68-40ff-abc1-1ae5c31b358b","year":2022},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.463913Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:13209c295f49b974092d230efcfab4c6ae91c545119b62921689f4249e913267","observation_id":"257ccca1-7c6c-4e00-bdda-02925ad0f94e","resolution":{"observed_at":"2026-08-06T13:06:32.909052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.886743Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"63080c93-baf1-43dd-8ed3-3cd502e91077","year":2020},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.468816Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:7cfaf479bf52a70f3cf279adb6c6b3d4a15df8decfb847011bb29288a1c9d204","observation_id":"ba59590b-e618-4bec-baca-a6ae722e81ac","resolution":{"observed_at":"2026-08-06T13:06:32.891898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T13:06:32.473790Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.473790Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:706d875ffa28d7e2e16eabc2db99c71b7e250f4e23d5ccced5df4d02f6ebb235","observation_id":"1cfc025b-b6c0-4950-a669-f6b8aeeb1eac","resolution":{"observed_at":"2026-08-06T13:06:32.473790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.869356Z","title":null,"venue":null,"work_id":"083e2a2e-a830-4f9c-9505-230991abe8a8","year":2024},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.479004Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:9010846ac672ba2d5365c52d153159f689630ce2b19e7fbd367c1819e54d768d","observation_id":"f60b4162-d92c-456d-a661-93715900ebbe","resolution":{"observed_at":"2026-08-06T13:06:32.874037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2206.06190","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.674389Z","title":"Transrec: Learning transferable recommendation from mixture-of-modality feedback","venue":null,"work_id":"3abff8b4-8bf9-4ca2-8d55-eee78ce54678","year":2022},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.486609Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:a63fc56d0612ae03ce9311dc1aaee44e04e450447abff402fba3359b443bb6fb","observation_id":"b5e0e357-3cea-4b17-9434-9ac56afaef47","resolution":{"observed_at":"2026-08-06T13:06:32.684421Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-06T13:06:32.492596Z","title":"Behavior regularized offline rein- forcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.492596Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:50d58ec88c31720df48a4cd48bd81252ea525f5f517caeb03cc4e1803b0ee397","observation_id":"d51c539b-01bf-43af-8f05-39fdd9744ee8","resolution":{"observed_at":"2026-08-06T13:06:32.492596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T13:06:32.497705Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.497705Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:eeda887ea691463db73533b41db99b237d5fbd9565820cce2cb9b419d85a6798","observation_id":"4095c89b-7e48-4600-bee7-e7563e198836","resolution":{"observed_at":"2026-08-06T13:06:32.497705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:06:32.852647Z","title":"Drn: A deep reinforcement learning framework for news recommendation","venue":null,"work_id":"e6f2dcfc-e3e4-4f60-b4c2-47df14e425f5","year":2018},"citing_paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:06:32.504261Z"},"links":{"citing_paper":"/paper/2507.21274"},"observation_digest":"sha256:4803c1282aeb5a886a1dc4eb99e2cd0d7607b178761c9568a16c9ae8437d2c00","observation_id":"3bd8393f-bddc-4a8e-b59c-d6c18f435ca0","resolution":{"observed_at":"2026-08-06T13:06:32.857292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21274","last_updated":"2025-07-28T19:00:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T17:04:11.524026Z","submitted_at":"2025-07-28T19:00:40Z","title":"Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.21274."}