Releases a public trace of coding-agent LLM sessions and characterizes workload features including long loops, context lengths, tool diversity, and cache hit rates for serving optimization.
Openassistant conversations – democratizing large language model alignment
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
verdicts
UNVERDICTED 2representative citing papers
A survey deriving a unified policy gradient framework for LLM post-training methods and providing technical comparisons of PPO, GRPO, DPO variants.
citing papers explorer
-
TraceLab: Characterizing Coding Agent Workloads for LLM Serving
Releases a public trace of coding-agent LLM sessions and characterizes workload features including long loops, context lengths, tool diversity, and cache hit rates for serving optimization.
-
Reinforcement Learning for LLM Post-Training: A Survey
A survey deriving a unified policy gradient framework for LLM post-training methods and providing technical comparisons of PPO, GRPO, DPO variants.