{"as_of":"2026-08-07T16:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:075332faa3335f30a9ede215514d1ac13b156f1f17c990eda8b39f2c2c622c54","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:33.875901Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:16:36.284072Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:25:51.272020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":"2506.19235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-01T17:25:51.272020Z","title":null,"venue":null,"work_id":"73ea0f8a-d0e7-4ec1-86e2-b55fbae0c74b","year":2025},"citing_paper":{"arxiv_id":"2605.11874","last_updated":"2026-05-12T09:52:21Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:52:21Z","title":"RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:04:08.454422Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2605.11874"},"observation_digest":"sha256:03e6915241dd02cbe73826a8bf5e8166c887bd33b9718d982fa88c80eefaf195","observation_id":"13e11885-dd8a-4e4c-8915-2f8240635264","resolution":{"observed_at":"2026-05-13T05:07:17.520568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":"2506.19235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-01T17:25:51.272020Z","title":null,"venue":null,"work_id":"73ea0f8a-d0e7-4ec1-86e2-b55fbae0c74b","year":2025},"citing_paper":{"arxiv_id":"2606.27684","last_updated":"2026-06-26T03:29:48Z","snapshot_observed_at":"2026-08-06T15:39:50.800482Z","submitted_at":"2026-06-26T03:29:48Z","title":"Intuition-Guided Latent Reasoning for LLM-Based Recommendation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T03:46:05.076346Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2606.27684"},"observation_digest":"sha256:85bfec4b3aa7775d8929fb7a4bfaf8d9c7e2c461ce564a947114440d8dadd730","observation_id":"9ca45276-c3f9-447a-b9eb-192a5ea914a9","resolution":{"observed_at":"2026-07-01T17:25:51.273725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-31T15:16:36.284072Z","title":"RecLLM-R1: A two-stage training paradigm with reinforcement learning and chain-of-thought.arXiv preprint arXiv:2506.19235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.284072Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:a65a3d431cacd91040c50495dd640cb3b3cfe0134b99c2a38933e1bbaa7dccd9","observation_id":"256a2bc7-e757-49fd-98e6-8408da8096ee","resolution":{"observed_at":"2026-07-31T15:16:36.284072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19235/citation-record","integrity":"/paper/2506.19235/integrity","json":"/paper/2506.19235/citation-record.json","paper":"/paper/2506.19235"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:12:30.692673Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.692673Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:7a1fda26414de54702b9e2334a7c5b8f1e6a7d8434da13ddf175a20ba7062727","observation_id":"97ae766d-9af7-486d-8c84-23a3e1a74090","resolution":{"observed_at":"2026-08-06T23:12:30.692673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:30.725331Z","title":"Reinforcement learning based recommender systems: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.725331Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:30fead07a47250eae00b4125d9491a52f9b6fbfe937bdab71cb6510b06d5b384","observation_id":"34b0f6be-4581-4066-aff6-85c6a3977597","resolution":{"observed_at":"2026-08-06T23:12:30.725331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:30.805607Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.805607Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:aa8e62c98b39207a193b71f84eba759312352fae401e761d084a2e02bc0afb44","observation_id":"130a9e2c-3b63-4d38-9bf0-4fa19e436d94","resolution":{"observed_at":"2026-08-06T23:12:30.805607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.619873Z","title":"Twin: Two-stage interest network for lifelong user behavior modeling in ctr prediction at kuaishou","venue":null,"work_id":"d85315e0-8972-4893-b432-b0239e6c6b04","year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.883121Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:4b8e4ee32ed5b2052502136768bddf4c9fec5ec666f26ed29953ab1a23ab77cb","observation_id":"e760fceb-6a17-4112-99ae-838258a2de64","resolution":{"observed_at":"2026-08-06T23:12:35.662028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.470921Z","title":"Wide & deep learning for recommender systems","venue":null,"work_id":"321735b6-3cb1-40d6-b220-6cb8ba37d27c","year":2016},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.968617Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:4885c2f566b425d65a8d59c01880e0852992908d52db1c52b0e8af34f966c1d5","observation_id":"eed36b7d-a357-4938-98a8-6bf3c507493d","resolution":{"observed_at":"2026-08-06T23:12:35.608732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.384973Z","title":"Deep neural networks for youtube recommenda- tions","venue":null,"work_id":"4b8d45c7-2f04-45e6-95d4-8813e13b7c88","year":2016},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.060338Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:4dc3ef86a9509bc5600c2a342ac36445310a99f853a1b9f8ae3a4a7d84b3246b","observation_id":"24ee761f-9be1-44eb-8546-972628a2ca31","resolution":{"observed_at":"2026-08-06T23:12:35.408453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.185452Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.185452Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:968422792ba00d3a60d6761600af366c233148d35a04608417caca72dc02c0cc","observation_id":"7a2d09e1-dc40-4535-8cb9-a20d9ac91fbd","resolution":{"observed_at":"2026-08-06T23:12:31.185452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.298128Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.298128Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:10f6a8372bb42447a9c68ef287f5f55bc8732d5a243f026d1adc38612655f740","observation_id":"bc6abfcb-890a-4e8f-927e-4da5563e87b3","resolution":{"observed_at":"2026-08-06T23:12:31.298128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:12:31.465019Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.465019Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:30ba2a744d0e8a3e9f403aa6816eb67c0d7380fe9b16b6dbd3e541b72f9d2d91","observation_id":"c42f9214-9bfe-4dbc-8201-f17b69056f76","resolution":{"observed_at":"2026-08-06T23:12:31.465019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04247","last_updated":"2017-03-13T04:55:19Z","snapshot_observed_at":"2026-07-06T05:33:25.278531Z","submitted_at":"2017-03-13T04:55:19Z","title":"DeepFM: A Factorization-Machine based Neural Network for CTR Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04247","snapshot_observed_at":"2026-08-06T23:12:31.633989Z","title":"Deepfm: a factorization-machine based neural network for ctr prediction.arXiv preprint arXiv:1703.04247, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.633989Z"},"links":{"cited_paper":"/paper/1703.04247","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:ce17c36931501552085e34a89610ed12b441b6d78fa8f091d335c89105cf9955","observation_id":"28801878-da4f-4c7c-8d31-ec04558d3def","resolution":{"observed_at":"2026-08-06T23:12:31.633989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.742209Z","title":"Ups and downs: Modeling the visual evolution of fashion trends with one-class collaborative filtering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.742209Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:cd0061311fa94eb70e60968448be5d44db8da7c8322929a0c4100033421e8de8","observation_id":"c2c7126d-f7b1-45eb-ae0a-6b06c28c8506","resolution":{"observed_at":"2026-08-06T23:12:31.742209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.831740Z","title":"Neural collaborative filtering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.831740Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:cb15115b5a8c984347ec41dca31f20541fcd48e337a408002b3f844aaacbfc34","observation_id":"ea9f42bd-c89a-4cf1-b46f-25804ee9904f","resolution":{"observed_at":"2026-08-06T23:12:31.831740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06939","last_updated":"2016-03-29T14:52:58Z","snapshot_observed_at":"2026-07-31T19:00:00.136727Z","submitted_at":"2015-11-21T23:42:59Z","title":"Session-based Recommendations with Recurrent Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06939","snapshot_observed_at":"2026-08-06T23:12:31.924775Z","title":"Session-based recommendations with recurrent neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.924775Z"},"links":{"cited_paper":"/paper/1511.06939","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:b44d9ae39c69e3e5356d1103b8d6c190e9852f75c94edd513c9ecb4d8e4012e9","observation_id":"5c2f5c2d-7d15-4d33-8493-b03ab0e29e96","resolution":{"observed_at":"2026-08-06T23:12:31.924775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06176","last_updated":"2023-10-09T21:58:55Z","snapshot_observed_at":"2026-08-04T10:07:51.912113Z","submitted_at":"2023-10-09T21:58:55Z","title":"Factual and Personalized Recommendations using Language Models and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06176","snapshot_observed_at":"2026-08-06T23:12:32.008803Z","title":"Factual and personalized recommendations using language models and reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.008803Z"},"links":{"cited_paper":"/paper/2310.06176","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:1eba4bd8d904fdb2da0a26e3449272185a76b20c53194e6de15e214c8c608d57","observation_id":"5b11b211-b806-45c7-a53d-dc24d565891f","resolution":{"observed_at":"2026-08-06T23:12:32.008803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.228953Z","title":"Genrec: Large language model for generative recommendation","venue":null,"work_id":"d8e91290-fc0a-4bf9-96dd-28d5dd984339","year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.075922Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:f56a04ed852d934a735e063f1416f0c9aa013f59c7f63cf09beae874095eb180","observation_id":"7e9e8c6e-888d-46b0-ae30-8a298d9a3f66","resolution":{"observed_at":"2026-08-06T23:12:35.268155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.145328Z","title":"Self-attentive sequential recommendation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.145328Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:438f3e824f73d48ed0cba517b16c8eab39710fef60dfb0cab600d2960cc06010","observation_id":"9f4f6a9e-d85c-4ac2-b6ca-0cb54f9f9c80","resolution":{"observed_at":"2026-08-06T23:12:32.145328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.213858Z","title":"Matrix factorization techniques for recom- mender systems","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.213858Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:afb560dbdad8f4123099cdd35254b6e64d9cbdaf6d50d3eed18878d3e58cb29b","observation_id":"378042bc-9a5b-426e-ad55-61dc63f23aad","resolution":{"observed_at":"2026-08-06T23:12:32.213858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03879","last_updated":"2023-04-08T00:30:08Z","snapshot_observed_at":"2026-07-06T15:13:33.023550Z","submitted_at":"2023-04-08T00:30:08Z","title":"GPT4Rec: A Generative Framework for Personalized Recommendation and User Interests Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03879","snapshot_observed_at":"2026-08-06T23:12:32.288506Z","title":"Gpt4rec: A generative framework for personalized recommendation and user interests interpretation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.288506Z"},"links":{"cited_paper":"/paper/2304.03879","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:7632e9a446b31ff709cd95874c515b9ea92c1be32d201107f8e63f78e1b97cbd","observation_id":"3898939a-803c-4bef-b330-1e6d4fa7d26b","resolution":{"observed_at":"2026-08-06T23:12:32.288506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.130506Z","title":"Llara: Large language-recommendation assistant","venue":null,"work_id":"397f152e-3bf0-4e2a-9c61-7b1d2398a23f","year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.369158Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:a79dc42c62939a80c2d947e21064bcd3d1da9520af38855086f6bda5a1cd1f35","observation_id":"9daa28f9-c4e3-4621-b328-396bd34e7994","resolution":{"observed_at":"2026-08-06T23:12:35.153438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.045907Z","title":"Cascade ranking for operational e-commerce search","venue":null,"work_id":"c3ddf263-5812-48a2-a881-2d95e6ad51f2","year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.461444Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:d2a831b3ca6813e3dc04c68f519b687d2bc6273fc31f49354de53379e9f3bf79","observation_id":"ef15a54c-ffdd-406b-b832-fa79fd60956a","resolution":{"observed_at":"2026-08-06T23:12:35.087673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.519992Z","title":"Integrating large language models into recommendation via mutual augmentation and adaptive aggregation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.519992Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:882afaa94887151c6cd40bf6a33498223d4520363c85ce3526dec1deb3b641ab","observation_id":"ffb7c52d-7b33-4c9f-a3e8-666fd7c90c46","resolution":{"observed_at":"2026-08-06T23:12:32.519992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.644503Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.644503Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:219b32b75369c39f4e9c4c0b95dda7a20796288170bb43f1bde97f7712f0d348","observation_id":"f047dc14-655c-4a39-ac5f-a4da5245144b","resolution":{"observed_at":"2026-08-06T23:12:32.644503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.713350Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.713350Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:532738b6de2e294f385dfd2a767cfad0452c7badb465991b2b50251a38228ef4","observation_id":"5d034671-8f2e-45a7-81f1-49609fe7a2db","resolution":{"observed_at":"2026-08-06T23:12:32.713350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.944667Z","title":"Large language model based long-tail query rewriting in taobao search","venue":null,"work_id":"9626d63f-1429-4b40-a378-dc022d89ca51","year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.792471Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:bbd296bf3986117fdbc970eba840abb782ac15a1c0a918a2932c5f8269652f43","observation_id":"fdef5190-5935-4a90-a143-b96c92849146","resolution":{"observed_at":"2026-08-06T23:12:34.967595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.896220Z","title":"Rankflow: Joint optimization of multi-stage cascade ranking systems as flows","venue":null,"work_id":"d41c7cde-f41e-4a8d-87c8-6d7d1bcc238c","year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.865754Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:685d46477007e19944bf9b130b6e3fcbd34890e8bc93031ad862ad1627d2952c","observation_id":"057d0cc7-415f-4deb-83d2-6910b71dc400","resolution":{"observed_at":"2026-08-06T23:12:34.937120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.938700Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.938700Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:ee7e1141c3a541a32b12f387027182d04eb4562531e90833f559c22b10d77944","observation_id":"e4ad6fc9-d1e7-44a4-9888-a0ac34df5051","resolution":{"observed_at":"2026-08-06T23:12:32.938700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.010097Z","title":"Recommender systems with generative retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.010097Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:322fda4618b405e5e84552f0f06247abeb0ec18be514943ac0c603a39ea39623","observation_id":"9dbbb977-4b79-4568-8da1-7b7093d4630f","resolution":{"observed_at":"2026-08-06T23:12:33.010097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:12:33.093052Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.093052Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:efbfba0a264041dbf2e19c850924ea74973d2522925940e1713b5b0e45dbc27d","observation_id":"b9f09756-f522-4026-be76-82782b589466","resolution":{"observed_at":"2026-08-06T23:12:33.093052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:12:33.171005Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.171005Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:6d6a7e0ea84804c3d1eaf6569f306066beffed8dcbde762d20822ee7192e5ab4","observation_id":"3789c514-58a4-4d09-91aa-d06644610368","resolution":{"observed_at":"2026-08-06T23:12:33.171005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T23:12:33.229167Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.229167Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:cc5a35778eedc4ea2b6eb239cd5e3dced1054f13886380baafbefaea86c196d4","observation_id":"6d76c055-c758-4975-b431-e0b0da8ffbc5","resolution":{"observed_at":"2026-08-06T23:12:33.229167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.308287Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.308287Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:8d65b95a2e15436109f91ec002bc03b467c32180d85d71d9700d0aeba4715290","observation_id":"9f5341ee-59b9-4769-b59f-56cbbad49b78","resolution":{"observed_at":"2026-08-06T23:12:33.308287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.783451Z","title":"Bert4rec: Sequential recommendation with bidirectional encoder representations from transformer","venue":null,"work_id":"ef483b95-dca0-4bcd-b306-156d499d53ee","year":2019},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.359428Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:5c53f327daa039f104f41ac9d7f74ee585232410a46efe3f5bc1b7a945e86d4c","observation_id":"4e3bc0a5-59c6-44f5-97d9-3cc99f7c03ef","resolution":{"observed_at":"2026-08-06T23:12:34.807458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T23:12:33.416496Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.416496Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:64ddbd5279cbf981f5a44b63ba117a7816cdc295316dab3617fa52f2b8613e5d","observation_id":"2c78550a-e9ff-452b-bcbf-efc5fc1b878f","resolution":{"observed_at":"2026-08-06T23:12:33.416496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.451444Z","title":"Kerl: A knowledge-guided reinforcement learning model for sequential recommendation","venue":null,"work_id":"45dfc1b2-83fc-4b77-a696-838cd4c9c606","year":2020},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.538034Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:735701a08f19ea044b1f61e2e3578edbd718c33f4e3e046a8f819c84c7f12e8c","observation_id":"097aa803-1f42-4562-ab1e-f0891b819b15","resolution":{"observed_at":"2026-08-06T23:12:34.565605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.615151Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.615151Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:cfdd82a9106d273043704b583e13c374a52427d77b68dcd2b0ff9b83dba98559","observation_id":"99a8b067-e3fc-4988-a874-df705a14f3f4","resolution":{"observed_at":"2026-08-06T23:12:33.615151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07622","last_updated":"2023-06-07T17:55:58Z","snapshot_observed_at":"2026-07-06T15:26:34.939192Z","submitted_at":"2023-05-12T17:21:33Z","title":"PALR: Personalization Aware LLMs for Recommendation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07622","snapshot_observed_at":"2026-08-06T23:12:33.694178Z","title":"Palr: Personalization aware llms for recommendation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.694178Z"},"links":{"cited_paper":"/paper/2305.07622","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:0b07b56057f4c3d13aba1f66c23256ede9582f6bde50052464c7fa23778f71cc","observation_id":"6bd8d4bf-7194-45c8-b172-be0827d6c01a","resolution":{"observed_at":"2026-08-06T23:12:33.694178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.200669Z","title":"Feature-level deeper self-attention network for sequential recommendation","venue":null,"work_id":"d81d99ca-7bcf-4862-b210-a3f184a69ae4","year":2019},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.767884Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:8396a5456c0f58e72fadd467c83c4c3628a4de7fadae2af50ed295bdeb06ff6c","observation_id":"481ac885-beb2-4f72-a162-7174c3a6be73","resolution":{"observed_at":"2026-08-06T23:12:34.300878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.831335Z","title":"Deep interest network for click-through rate prediction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.831335Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:be5a0537edcde659e8526df6a334c2fa8ce49e1c6b22cdc3293260c419927ce7","observation_id":"2cb6e1b4-a622-47e9-96fe-14893ee14302","resolution":{"observed_at":"2026-08-06T23:12:33.831335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.875901Z","title":"S3-rec: Self-supervised learning for sequential recommendation with mutual information maximization","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.875901Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:2f5c6ec904923c618611744d53d578d7e4e4a66a166578734856898b0be0aa7b","observation_id":"37362ac1-d24e-4014-b74e-2b2e02f3b96a","resolution":{"observed_at":"2026-08-06T23:12:33.875901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2506.19235."}