Pith. sign in

Paper Citation Record · LEDGER

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2506.19235.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.19235 v1

Coverage vector

measured 39 of 39 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:12:33.875901Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-31T15:16:36.284072Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T17:25:51.272020Z

Reference resolution

39 of 39 outbound references displayed

  • verified exact0
  • verified fuzzy11
  • unresolved28
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 97ae766d-9af7-486d-8c84-23a3e1a74090 · outbound

This paper cites GPT-4 Technical Report.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:30.692673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:30.692673Z digest=sha256:7a1fda26414de54702b9e2334a7c5b8f1e6a7d8434da13ddf175a20ba7062727

Observation 34b0f6be-4581-4066-aff6-85c6a3977597 · outbound

This paper cites Reinforcement learning based recommender systems: A survey.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Reinforcement learning based recommender systems: A survey

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:30.725331Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:30.725331Z digest=sha256:30fead07a47250eae00b4125d9491a52f9b6fbfe937bdab71cb6510b06d5b384

Observation 130a9e2c-3b63-4d38-9bf0-4fa19e436d94 · outbound

This paper cites Language models are few-shot learners.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Language models are few-shot learners

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:30.805607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:30.805607Z digest=sha256:aa8e62c98b39207a193b71f84eba759312352fae401e761d084a2e02bc0afb44

Observation e760fceb-6a17-4112-99ae-838258a2de64 · outbound

This paper cites Twin: Two-stage interest network for lifelong user behavior modeling in ctr prediction at kuaishou.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Twin: Two-stage interest network for lifelong user behavior modeling in ctr prediction at kuaishou

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.662028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:30.883121Z digest=sha256:4b8e4ee32ed5b2052502136768bddf4c9fec5ec666f26ed29953ab1a23ab77cb

Observation eed36b7d-a357-4938-98a8-6bf3c507493d · outbound

This paper cites Wide & deep learning for recommender systems.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Wide & deep learning for recommender systems

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.608732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:30.968617Z digest=sha256:4885c2f566b425d65a8d59c01880e0852992908d52db1c52b0e8af34f966c1d5

Observation 24ee761f-9be1-44eb-8546-972628a2ca31 · outbound

This paper cites Deep neural networks for youtube recommenda- tions.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Deep neural networks for youtube recommenda- tions

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.408453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:31.060338Z digest=sha256:4dc3ef86a9509bc5600c2a342ac36445310a99f853a1b9f8ae3a4a7d84b3246b

Observation 7a2d09e1-dc40-4535-8cb9-a20d9ac91fbd · outbound

This paper cites Flashattention: Fast and memory-efficient exact attention with io-awareness.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Flashattention: Fast and memory-efficient exact attention with io-awareness

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.185452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.185452Z digest=sha256:968422792ba00d3a60d6761600af366c233148d35a04608417caca72dc02c0cc

Observation bc6abfcb-890a-4e8f-927e-4da5563e87b3 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Bert: Pre-training of deep bidirectional transformers for language understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.298128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.298128Z digest=sha256:10f6a8372bb42447a9c68ef287f5f55bc8732d5a243f026d1adc38612655f740

Observation c42f9214-9bfe-4dbc-8201-f17b69056f76 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.465019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.465019Z digest=sha256:30ba2a744d0e8a3e9f403aa6816eb67c0d7380fe9b16b6dbd3e541b72f9d2d91

Observation 28801878-da4f-4c7c-8d31-ec04558d3def · outbound

This paper cites DeepFM: A Factorization-Machine based Neural Network for CTR Prediction.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 DeepFM: A Factorization-Machine based Neural Network for CTR Prediction

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.633989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.633989Z digest=sha256:ce17c36931501552085e34a89610ed12b441b6d78fa8f091d335c89105cf9955

Observation c2c7126d-f7b1-45eb-ae0a-6b06c28c8506 · outbound

This paper cites Ups and downs: Modeling the visual evolution of fashion trends with one-class collaborative filtering.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Ups and downs: Modeling the visual evolution of fashion trends with one-class collaborative filtering

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.742209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.742209Z digest=sha256:cd0061311fa94eb70e60968448be5d44db8da7c8322929a0c4100033421e8de8

Observation ea9f42bd-c89a-4cf1-b46f-25804ee9904f · outbound

This paper cites Neural collaborative filtering.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Neural collaborative filtering

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.831740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.831740Z digest=sha256:cb15115b5a8c984347ec41dca31f20541fcd48e337a408002b3f844aaacbfc34

Observation 5c2f5c2d-7d15-4d33-8493-b03ab0e29e96 · outbound

This paper cites Session-based Recommendations with Recurrent Neural Networks.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Session-based Recommendations with Recurrent Neural Networks

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.924775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.924775Z digest=sha256:b44d9ae39c69e3e5356d1103b8d6c190e9852f75c94edd513c9ecb4d8e4012e9

Observation 5b11b211-b806-45c7-a53d-dc24d565891f · outbound

This paper cites Factual and Personalized Recommendations using Language Models and Reinforcement Learning.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Factual and Personalized Recommendations using Language Models and Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.008803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.008803Z digest=sha256:1eba4bd8d904fdb2da0a26e3449272185a76b20c53194e6de15e214c8c608d57

Observation 7e9e8c6e-888d-46b0-ae30-8a298d9a3f66 · outbound

This paper cites Genrec: Large language model for generative recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Genrec: Large language model for generative recommendation

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.268155Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:32.075922Z digest=sha256:f56a04ed852d934a735e063f1416f0c9aa013f59c7f63cf09beae874095eb180

Observation 9f4f6a9e-d85c-4ac2-b6ca-0cb54f9f9c80 · outbound

This paper cites Self-attentive sequential recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Self-attentive sequential recommendation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.145328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.145328Z digest=sha256:438f3e824f73d48ed0cba517b16c8eab39710fef60dfb0cab600d2960cc06010

Observation 378042bc-9a5b-426e-ad55-61dc63f23aad · outbound

This paper cites Matrix factorization techniques for recom- mender systems.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Matrix factorization techniques for recom- mender systems

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.213858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.213858Z digest=sha256:afb560dbdad8f4123099cdd35254b6e64d9cbdaf6d50d3eed18878d3e58cb29b

Observation 3898939a-803c-4bef-b330-1e6d4fa7d26b · outbound

This paper cites GPT4Rec: A Generative Framework for Personalized Recommendation and User Interests Interpretation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 GPT4Rec: A Generative Framework for Personalized Recommendation and User Interests Interpretation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.288506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.288506Z digest=sha256:7632e9a446b31ff709cd95874c515b9ea92c1be32d201107f8e63f78e1b97cbd

Observation 9daa28f9-c4e3-4621-b328-396bd34e7994 · outbound

This paper cites Llara: Large language-recommendation assistant.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Llara: Large language-recommendation assistant

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.153438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:32.369158Z digest=sha256:a79dc42c62939a80c2d947e21064bcd3d1da9520af38855086f6bda5a1cd1f35

Observation ef15a54c-ffdd-406b-b832-fa79fd60956a · outbound

This paper cites Cascade ranking for operational e-commerce search.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Cascade ranking for operational e-commerce search

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.087673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:32.461444Z digest=sha256:d2a831b3ca6813e3dc04c68f519b687d2bc6273fc31f49354de53379e9f3bf79

Observation ffb7c52d-7b33-4c9f-a3e8-666fd7c90c46 · outbound

This paper cites Integrating large language models into recommendation via mutual augmentation and adaptive aggregation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Integrating large language models into recommendation via mutual augmentation and adaptive aggregation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.519992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.519992Z digest=sha256:882afaa94887151c6cd40bf6a33498223d4520363c85ce3526dec1deb3b641ab

Observation f047dc14-655c-4a39-ac5f-a4da5245144b · outbound

This paper cites Human-level control through deep reinforcement learning.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Human-level control through deep reinforcement learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.644503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.644503Z digest=sha256:219b32b75369c39f4e9c4c0b95dda7a20796288170bb43f1bde97f7712f0d348

Observation 5d034671-8f2e-45a7-81f1-49609fe7a2db · outbound

This paper cites Training language models to follow instructions with human feedback.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Training language models to follow instructions with human feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.713350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.713350Z digest=sha256:532738b6de2e294f385dfd2a767cfad0452c7badb465991b2b50251a38228ef4

Observation fdef5190-5935-4a90-a143-b96c92849146 · outbound

This paper cites Large language model based long-tail query rewriting in taobao search.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Large language model based long-tail query rewriting in taobao search

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.967595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:32.792471Z digest=sha256:bbd296bf3986117fdbc970eba840abb782ac15a1c0a918a2932c5f8269652f43

Observation 057d0cc7-415f-4deb-83d2-6910b71dc400 · outbound

This paper cites Rankflow: Joint optimization of multi-stage cascade ranking systems as flows.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Rankflow: Joint optimization of multi-stage cascade ranking systems as flows

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.937120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:32.865754Z digest=sha256:685d46477007e19944bf9b130b6e3fcbd34890e8bc93031ad862ad1627d2952c

Observation e4ad6fc9-d1e7-44a4-9888-a0ac34df5051 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Direct preference optimization: Your language model is secretly a reward model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.938700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.938700Z digest=sha256:ee7e1141c3a541a32b12f387027182d04eb4562531e90833f559c22b10d77944

Observation 9dbbb977-4b79-4568-8da1-7b7093d4630f · outbound

This paper cites Recommender systems with generative retrieval.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Recommender systems with generative retrieval

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.010097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.010097Z digest=sha256:322fda4618b405e5e84552f0f06247abeb0ec18be514943ac0c603a39ea39623

Observation b9f09756-f522-4026-be76-82782b589466 · outbound

This paper cites Proximal Policy Optimization Algorithms.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Proximal Policy Optimization Algorithms

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.093052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.093052Z digest=sha256:efbfba0a264041dbf2e19c850924ea74973d2522925940e1713b5b0e45dbc27d

Observation 3789c514-58a4-4d09-91aa-d06644610368 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.171005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.171005Z digest=sha256:6d6a7e0ea84804c3d1eaf6569f306066beffed8dcbde762d20822ee7192e5ab4

Observation 6d76c055-c758-4975-b431-e0b0da8ffbc5 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 HybridFlow: A Flexible and Efficient RLHF Framework

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.229167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.229167Z digest=sha256:cc5a35778eedc4ea2b6eb239cd5e3dced1054f13886380baafbefaea86c196d4

Observation 9f5341ee-59b9-4769-b59f-56cbbad49b78 · outbound

This paper cites Learning to summarize with human feedback.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Learning to summarize with human feedback

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.308287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.308287Z digest=sha256:8d65b95a2e15436109f91ec002bc03b467c32180d85d71d9700d0aeba4715290

Observation 4e3bc0a5-59c6-44f5-97d9-3cc99f7c03ef · outbound

This paper cites Bert4rec: Sequential recommendation with bidirectional encoder representations from transformer.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Bert4rec: Sequential recommendation with bidirectional encoder representations from transformer

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.807458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:33.359428Z digest=sha256:5c53f327daa039f104f41ac9d7f74ee585232410a46efe3f5bc1b7a945e86d4c

Observation 2c78550a-e9ff-452b-bcbf-efc5fc1b878f · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 LLaMA: Open and Efficient Foundation Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.416496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.416496Z digest=sha256:64ddbd5279cbf981f5a44b63ba117a7816cdc295316dab3617fa52f2b8613e5d

Observation 097aa803-1f42-4562-ab1e-f0891b819b15 · outbound

This paper cites Kerl: A knowledge-guided reinforcement learning model for sequential recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Kerl: A knowledge-guided reinforcement learning model for sequential recommendation

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.565605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:33.538034Z digest=sha256:735701a08f19ea044b1f61e2e3578edbd718c33f4e3e046a8f819c84c7f12e8c

Observation 99a8b067-e3fc-4988-a874-df705a14f3f4 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Chain-of-thought prompting elicits reasoning in large language models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.615151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.615151Z digest=sha256:cfdd82a9106d273043704b583e13c374a52427d77b68dcd2b0ff9b83dba98559

Observation 6bd8d4bf-7194-45c8-b172-be0827d6c01a · outbound

This paper cites PALR: Personalization Aware LLMs for Recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 PALR: Personalization Aware LLMs for Recommendation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.694178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.694178Z digest=sha256:0b07b56057f4c3d13aba1f66c23256ede9582f6bde50052464c7fa23778f71cc

Observation 481ac885-beb2-4f72-a162-7174c3a6be73 · outbound

This paper cites Feature-level deeper self-attention network for sequential recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Feature-level deeper self-attention network for sequential recommendation

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.300878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:33.767884Z digest=sha256:8396a5456c0f58e72fadd467c83c4c3628a4de7fadae2af50ed295bdeb06ff6c

Observation 2cb6e1b4-a622-47e9-96fe-14893ee14302 · outbound

This paper cites Deep interest network for click-through rate prediction.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Deep interest network for click-through rate prediction

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.831335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.831335Z digest=sha256:be5a0537edcde659e8526df6a334c2fa8ce49e1c6b22cdc3293260c419927ce7

Observation 37362ac1-d24e-4014-b74e-2b2e02f3b96a · outbound

This paper cites S3-rec: Self-supervised learning for sequential recommendation with mutual information maximization.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 S3-rec: Self-supervised learning for sequential recommendation with mutual information maximization

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.875901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.875901Z digest=sha256:2f5c6ec904923c618611744d53d578d7e4e4a66a166578734856898b0be0aa7b

Pith citing papers

Observation 13e11885-dd8a-4e4c-8915-2f8240635264 · inbound

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems cites this paper.

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:07:17.520568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-13T05:04:08.454422Z digest=sha256:03e6915241dd02cbe73826a8bf5e8166c887bd33b9718d982fa88c80eefaf195

Observation 9ca45276-c3f9-447a-b9eb-192a5ea914a9 · inbound

Intuition-Guided Latent Reasoning for LLM-Based Recommendation cites this paper.

Intuition-Guided Latent Reasoning for LLM-Based Recommendation RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

Reference 57

Resolution
verified exact
arxiv_id, observed 2026-07-01T17:25:51.273725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-29T03:46:05.076346Z digest=sha256:270a8670823e4c1c05e62831eacb7f9e4b55331c4d37f992ecdd6f34127a9770

Observation 256a2bc7-e757-49fd-98e6-8408da8096ee · inbound

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning cites this paper.

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-31T15:16:36.284072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T15:16:36.284072Z digest=sha256:a65a3d431cacd91040c50495dd640cb3b3cfe0134b99c2a38933e1bbaa7dccd9