SAPO computes per-reasoning-step group-relative advantages in RL to improve credit assignment for structured generation of semantic identifiers in recommendation systems.
Actions speak louder than words: Trillion-parameter sequential transducers for generative recommendations
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
years
2026 2verdicts
UNVERDICTED 2representative citing papers
TriAlignGR introduces cross-modal alignment, deep interest mining via CoT, and triangular multitask training to fix semantic degradation and opacity in SID-based generative recommendation.
citing papers explorer
-
SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation
SAPO computes per-reasoning-step group-relative advantages in RL to improve credit assignment for structured generation of semantic identifiers in recommendation systems.
-
TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation
TriAlignGR introduces cross-modal alignment, deep interest mining via CoT, and triangular multitask training to fix semantic degradation and opacity in SID-based generative recommendation.