{"as_of":"2026-08-04T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c0e4e5a1fe1b31871e754ed5c1a2f20fdbbf8bded2cb2552040bdeb0b1a0562","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:24:28.048403Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:44:32.617211Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10029","snapshot_observed_at":"2026-08-01T02:44:32.617211Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.617211Z"},"links":{"cited_paper":"/paper/2604.10029","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:40ee6fec1a31ac6360a274cc88f14e831b1f9c39ec2392bf599cc0cbc8e964e7","observation_id":"5ba483d8-be47-44fc-a746-f91a8801b4f8","resolution":{"observed_at":"2026-08-01T02:44:32.617211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.10029/citation-record","integrity":"/paper/2604.10029/integrity","json":"/paper/2604.10029/citation-record.json","paper":"/paper/2604.10029"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-attentive sequential recommenda- tion","venue":null,"work_id":"6c44486c-46ed-4314-84bd-a13c54c4defd","year":2018},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:fb408df0c39673aa2c2268c5d3ce84067c23cb37b0e028cce7a3d743760524ad","observation_id":"d53063b9-aecc-4e31-be81-8f8160b9b60f","resolution":{"observed_at":"2026-05-17T15:31:55.807390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lightgcn: Simplifying and powering graph convolution network for recommenda- tion","venue":null,"work_id":"4a6a81bf-12fa-409b-8a87-f16108336d05","year":2020},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:f85f58447b9ea80fb6e557622289ae0c4735e4f962f13e14d423a39c9d21ed96","observation_id":"004673d4-d277-4971-b29c-fba74226ca7d","resolution":{"observed_at":"2026-05-17T15:31:55.802483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient bi- level optimization for recommendation denoising","venue":null,"work_id":"839e0208-1ba0-4134-b3d9-148bc29ec5a4","year":2023},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:50b67187be7f77653d2a24f055303a779be7b15feb3cb0459f68215b2283d7f7","observation_id":"e049c78f-75df-454b-b40a-8083d12d1d15","resolution":{"observed_at":"2026-05-17T15:31:55.800251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentic feedback loop modeling improves recommendation and user simulation","venue":null,"work_id":"e088f30e-575d-4006-aec3-1e149da4939a","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:895a2af138230b09d2b98d6464647c76d9a9170b5d59edbf0ef171ae8cb7a265","observation_id":"265aa792-383e-4cc8-8233-2462ee8e66bb","resolution":{"observed_at":"2026-05-17T15:31:55.804911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"iagent: Llm agent as a shield between user and recommender systems","venue":null,"work_id":"a711d75f-bb59-4e96-b3c9-d84795b3b0f0","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:8717278ec129d2e4e268d87a05eeea2024da449851c3ffa39c30935ff259efd8","observation_id":"f6a94efa-f04f-4547-884e-ed9b78454830","resolution":{"observed_at":"2026-05-17T15:31:55.810037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On generative agents in recommendation","venue":null,"work_id":"a544eb22-6f91-4d57-9912-b5d5660c30c4","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:44c139e2f831ba4d767dd05744148b233ef5fe26e6fe7d43ef830fae2ad218c1","observation_id":"a19e5a89-2daa-4e0d-9bc9-d48983e9e6ad","resolution":{"observed_at":"2026-05-17T15:31:55.812149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recommender ai agent: Integrating large language models for interactive recommen- dations","venue":null,"work_id":"10485d1e-1400-4c85-8791-e8ab8f8a77cf","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:c9f983bde0655a67336a794ee3a955f9eff4e0c9a27faafc069c464a91a9e7cc","observation_id":"a2014003-e152-4844-8471-6910c3a0d9d7","resolution":{"observed_at":"2026-05-17T15:31:55.819617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:56:29.594179Z","title":"Re- flexion: Language agents with verbal reinforcement learning","venue":null,"work_id":"f1386d00-b17b-4a6f-ab98-78dc28287803","year":2023},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:27907d043b366280fcdc16d7d1f4dcd01cd06fcabd08b64cfd07fd1a6b454c8a","observation_id":"424c98d2-d34e-440c-91a8-6febe9ff8d0f","resolution":{"observed_at":"2026-05-17T15:31:55.824593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Entropy guided diversification and preference elicitation in agentic recommendation systems","venue":null,"work_id":"894da242-bc6a-41bb-b0b7-fec65b8b4675","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:c393ceb7986fba0495c9f3165ec8f1768912823209dc1857e27a04445a09888f","observation_id":"bbca6b1a-1446-430e-a2b5-bf9631f2e591","resolution":{"observed_at":"2026-05-11T08:56:02.127976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:51:40.290902Z","title":"Memorybank: En- hancing large language models with long-term memory","venue":null,"work_id":"6e4e7fff-d335-4f41-8712-c8b496fb0bf5","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:8c8968cfcca7ebe53e1d660b0e0135593b90b552fc5704e9c8f3633f361ecc9a","observation_id":"1e6a731c-e948-40f1-926a-1d0f766b3e70","resolution":{"observed_at":"2026-05-17T15:31:55.827397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12110","last_updated":"2025-10-08T01:46:37Z","snapshot_observed_at":"2026-08-03T02:27:06.991396Z","submitted_at":"2025-02-17T18:36:14Z","title":"A-MEM: Agentic Memory for LLM Agents","version":11},"cited_work":{"arxiv_id":"2502.12110","doi":"10.48550/arxiv.2502.12110","metadata_source":"pith","pith_arxiv_id":"2502.12110","snapshot_observed_at":"2026-07-11T03:27:46.348461Z","title":"A-MEM: Agentic Memory for LLM Agents","venue":"cs.CL","work_id":"3b98feb2-fdb1-479a-bbe4-2c298a4592e2","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2502.12110","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:e6b1ad26c8caf6dde00ed24b6c1ad87a1a12562ce680da8d6432b7c618477718","observation_id":"e05d95aa-3ffd-4d06-a64a-c59c7d9b43f1","resolution":{"observed_at":"2026-05-11T08:56:02.212756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tallrec: An effective and efficient tuning framework to align large language model with recommendation","venue":null,"work_id":"f367cf1e-fcff-4f5b-be54-9643d3c13d83","year":2023},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:8c6786dd7860ad8ecd2fefcbf0134d51068067013de8dc766d7cd6d331d596a3","observation_id":"92f4dbd6-ee38-4495-ae89-95f6a3f1f76b","resolution":{"observed_at":"2026-05-17T15:31:55.787562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:7e32bc9078f01d214de4b5671cdee9ecca2fa67539dfbc5ed41a807c07e897a0","observation_id":"c5bd9325-2b47-4bde-89ee-3988d8ff067d","resolution":{"observed_at":"2026-05-11T08:56:02.225700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:30898c94aee99ed4afea3e20a909ef59fcffcb1d7002e017883fb42e10137f5b","observation_id":"027e70ce-192f-4647-becc-138042797b73","resolution":{"observed_at":"2026-05-11T08:56:02.179684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:40:43.936242Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning","venue":null,"work_id":"2511f0d8-5566-4530-8ebd-8a91d61833ef","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:53d5a788f5d4fe447525e18e611244ee52959d065638388f837c712fdbbe92cf","observation_id":"2035d37c-4579-4a40-a1e1-93e3616bfd03","resolution":{"observed_at":"2026-05-17T15:31:55.792482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08837","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:16.319621Z","title":"Amem4rec: Leveraging cross-user similarity for memory evolution in agentic llm recom- menders","venue":null,"work_id":"13c4a1f3-f517-4299-8572-04d1b0077c84","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:687bc3c2d354414f03af8585703aa1623b9f03dac2cb808b08378ebe5b6f799f","observation_id":"a91d93f1-b305-491a-b8e3-0a7b3f18dc95","resolution":{"observed_at":"2026-05-11T08:56:02.121845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:46:28.203038Z","title":"A survey on agent-as-a-judge","venue":null,"work_id":"87fad81b-b92e-4cdd-8ed9-4b3eab319533","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:c1e59e40b9d32dd66622e8b7133bee5e156cb72e2a0f070103efefee0b9603c6","observation_id":"5baec4f5-324a-4310-8ac3-69bae702ccd3","resolution":{"observed_at":"2026-05-11T08:56:02.220165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10397","last_updated":"2026-07-25T20:09:07Z","snapshot_observed_at":"2026-07-30T23:52:01.172451Z","submitted_at":"2025-09-12T16:44:34Z","title":"RecoWorld: Building Simulated Environments for Agentic Recommender Systems","version":3},"cited_work":{"arxiv_id":"2509.10397","doi":"10.48550/arxiv.2509.10397","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10397","snapshot_observed_at":"2026-07-28T02:22:23.314678Z","title":"Recoworld: Building simulated environments for agentic recommender systems","venue":null,"work_id":"7cccb845-4121-4179-8cf6-9a3f82033894","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2509.10397","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:3e644e56476f7ab217e8a69c5e0d853b337925130dfc32879f612a4bc2c64e28","observation_id":"9a9f5a69-edd7-4e7b-86e0-fae84021fd1f","resolution":{"observed_at":"2026-07-28T02:22:23.314678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23374","last_updated":"2025-03-30T09:19:03Z","snapshot_observed_at":"2026-07-06T21:01:00.397040Z","submitted_at":"2025-03-30T09:19:03Z","title":"RuleAgent: Discovering Rules for Recommendation Denoising with Autonomous Language Agents","version":1},"cited_work":{"arxiv_id":"2503.23374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23374","snapshot_observed_at":"2026-07-02T15:27:04.844660Z","title":"Ruleagent: Discovering rules for recommendation denoising with autonomous language agents","venue":null,"work_id":"7ba38bff-b9ce-4040-acd4-6f0c2f8c6e71","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2503.23374","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:504dd5c3f046d3467ddceeee04b1f7cac82bd888ce11433134057f335c55b172","observation_id":"9ae63de2-cb16-4583-bad8-6ddbaa637a2f","resolution":{"observed_at":"2026-05-11T08:56:02.140206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Macrec: A multi- agent collaboration framework for recommendation","venue":null,"work_id":"d87fc038-c483-4457-bfe7-3b69a101e37a","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:979ce34913dc7dd46e4bcb83b550328ac0b5e5858f3ed17bb3b40268a5640e65","observation_id":"4f33a700-ae2c-4547-8713-6ffdaa565abe","resolution":{"observed_at":"2026-05-17T15:31:55.780685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02482","doi":"10.48550/arxiv.2602.02482","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2602.02482 , year=","venue":null,"work_id":"c9552e44-1e80-45df-b599-f8554214e923","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:19f371e40324ecf69d4dd078073f67a3916ea1e4da2f613984616b1aeda85b0a","observation_id":"9664e998-438a-4047-8696-33e059526f36","resolution":{"observed_at":"2026-05-11T08:56:02.173063Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Treerl: Llm reinforcement learning with on-policy tree search","venue":null,"work_id":"413f0ffa-6b53-41ce-bddf-e7b6cb09c955","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:c12577e65ba46b0c1c887f1d59b44c3a6796b7ab0eb6439b4be55345996d12d1","observation_id":"8ccd2e18-9a25-4da2-8a73-d799961d75c3","resolution":{"observed_at":"2026-05-17T15:31:55.785196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Supervised pretraining can learn in-context reinforcement learning","venue":null,"work_id":"8fb0f895-8c5c-4f80-ac3a-90c33764c6da","year":2023},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:bd1da7fd1332446ad0e7960830c9da597fcdf26ab798208876722cbfc773d661","observation_id":"aa9dd6c5-6bd4-4fc7-855d-5344e529ec31","resolution":{"observed_at":"2026-05-17T15:31:55.773319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06303","last_updated":"2026-04-24T20:21:17Z","snapshot_observed_at":"2026-07-06T21:38:06.355762Z","submitted_at":"2025-05-21T16:15:01Z","title":"Reward Is Enough: LLMs Are In-Context Reinforcement Learners","version":6},"cited_work":{"arxiv_id":"2506.06303","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06303","snapshot_observed_at":"2026-07-09T14:36:17.482340Z","title":"Reward Is Enough: LLMs Are In-Context Reinforcement Learners","venue":"cs.LG","work_id":"5dc0d5da-1a2e-4ddc-b553-3181975227d0","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2506.06303","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:61c093b15239de77f704b51257440bb537102995ac25489f2418e51e07f84368","observation_id":"3be3a04a-107c-4a9a-886c-3834f5d9d2c6","resolution":{"observed_at":"2026-05-11T08:56:02.070609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-10T18:17:33.857604Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:ca24dba79913455b732498afc5049f5d2289994a0d61f1de1c9fcacdc84874f4","observation_id":"3348998f-c5a2-4a65-bca7-2bc632d57b7f","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-10T16:57:24.571259Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:7a7ab6dde781be7e0303f832ff5686e32c31b7c1ddcd01bfb5d6fab5748fbf2b","observation_id":"491749b6-12b7-4845-92e4-515c786d01c9","resolution":{"observed_at":"2026-05-12T05:31:52.723793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-10T16:57:24.584548Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:29e0a4da7889626395596e25879889658b82620b3e1275bee857246b6a6ba82d","observation_id":"c9b4f882-5512-42be-ad90-1f98b2eec84c","resolution":{"observed_at":"2026-05-12T04:29:18.795354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":"2604.03128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-07T12:33:45.187943Z","title":"Self-Distilled RLVR","venue":"cs.LG","work_id":"935a34f3-b83d-4214-b6a0-ae2395b3d107","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:a63780ebe0706642f3c82a12be9bbf4c5af70bce51389388dd6aa2afb0266992","observation_id":"887d32f4-fa2f-46ef-a8cb-213c931246c8","resolution":{"observed_at":"2026-05-11T08:56:02.092723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Second workshop on infor- mation heterogeneity and fusion in recommender systems (hetrec2011)","venue":null,"work_id":"13a67a4b-de4f-4d78-9809-5a98789faa01","year":2011},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:3a4ca39a09b7ff261db70d00a283534ccf4c86b8f4acf87875bdea54ab321535","observation_id":"20a7b5c6-b756-45ab-a252-800e25f92d69","resolution":{"observed_at":"2026-05-17T15:31:55.775887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:42.342559Z","title":"The movielens datasets: History and context","venue":null,"work_id":"a016288d-b175-4aa5-9f85-9fb85431c601","year":2015},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:ebb2b6bb3473fab3731c0c40e16323c5798f770dc2717b506871e181724664bb","observation_id":"94b0ae1d-bbed-426b-ac67-6784f6ac5fdb","resolution":{"observed_at":"2026-05-17T15:31:55.778186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03952","last_updated":"2026-04-20T06:05:54Z","snapshot_observed_at":"2026-08-03T00:56:47.399756Z","submitted_at":"2024-03-06T18:56:36Z","title":"Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders","version":2},"cited_work":{"arxiv_id":"2403.03952","doi":"10.1007/978-3-031-56060-6","metadata_source":"pith","pith_arxiv_id":"2403.03952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders","venue":"cs.IR","work_id":"357c2b19-af52-48bc-a55a-e34d2d84b8ff","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2403.03952","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:f66ba7584c60bad7be670bd214e57acfb6fdf55ce3d1c6ef42274f09d8daa0c7","observation_id":"e6248ad7-e440-4414-bfd1-9e47d9fef17b","resolution":{"observed_at":"2026-05-11T08:56:02.195798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let me do it for you: Towards llm empowered recommendation via tool learning","venue":null,"work_id":"911a31d6-831e-4b5a-aaaa-f8f4c2386535","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:c262c918e3f23c548dd952d9fc5d9095bb1bafcf421d35870718c0a5433808db","observation_id":"25c7840d-4141-441b-a28f-73e075306bd7","resolution":{"observed_at":"2026-05-17T15:31:55.782938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:06:19.499281Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"2a6edf62-cd2d-4bb1-860e-ffa7d9bb1b25","year":2022},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:5c36af045c8a6e26e903088188e43a00b52b807f7ae06189a817c228f8e8896e","observation_id":"708f2f17-0135-4b9d-8ab7-89c46c7bac65","resolution":{"observed_at":"2026-05-17T15:31:55.789867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:839c4654fa2e76bb7f5f7fe926d9453e3135b2b4f10f33794f10ff1c21a26a97","observation_id":"e39cb58a-cef5-4ab6-9188-47a402cb0ef6","resolution":{"observed_at":"2026-05-12T03:54:31.187112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Negotiating the shared agency between humans & ai in the recommender system","venue":null,"work_id":"96a6dbc5-3a6b-455e-8a6c-cbd2e94b207d","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:72123947f7c759892c42a00e10e95d4730cfa18bbf17bc5ee468b47a0debd423","observation_id":"6dd8baba-c873-45ae-bac6-a8e256312811","resolution":{"observed_at":"2026-05-17T15:31:55.795096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"User behavior simulation with large lan- guage model-based agents","venue":null,"work_id":"18c764ae-0784-43b3-957e-d8cfabaf7ded","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:f81ddf815bf98cc00ff0303bef3b4b934e3470fca38e75d9ced0484594485b7a","observation_id":"bc2b7259-1584-4f12-afc5-494c5223dbe1","resolution":{"observed_at":"2026-05-17T15:31:55.830002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recmind: Large language model powered agent for recommendation","venue":null,"work_id":"472a0067-1caf-47fc-acb3-4afce8c0162b","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:467ed3c03011772dd75f08529f5f1cb9bfc313c9965fe6473e43e3293844077f","observation_id":"2153ce36-707b-4465-9fa8-4d405eba717b","resolution":{"observed_at":"2026-05-17T15:31:55.817428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Id-free not risk-free: Llm-powered agents unveil risks in id- free recommender systems","venue":null,"work_id":"ca5a9385-0afe-4553-9669-9a202242b947","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:a4f5cba28cf9fcd9e36bb5f16817e0556090480b5afeff965c6a840383ba553b","observation_id":"3d8a3fc9-d1e3-44e3-8ab7-a1ebcbdf9dca","resolution":{"observed_at":"2026-05-17T15:31:55.814834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08816","last_updated":"2026-04-28T05:13:03Z","snapshot_observed_at":"2026-08-02T05:00:09.693873Z","submitted_at":"2026-01-13T18:51:16Z","title":"MemRec: Collaborative Memory-Augmented Agentic Recommender System","version":3},"cited_work":{"arxiv_id":"2601.08816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.08816","snapshot_observed_at":"2026-06-28T18:42:29.315106Z","title":"MemRec: Collaborative Memory-Augmented Agentic Recommender System","venue":"cs.IR","work_id":"fb73c690-000a-4578-a45a-622b90b60240","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2601.08816","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:f1b71a948fae4a8b16b69c5f374545c6b582c798052240fd68e04f6d38899465","observation_id":"8b804b5b-c66a-4187-bc16-60ab154bb62a","resolution":{"observed_at":"2026-05-11T08:56:02.160365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentcf: Collaborative learning with autonomous language agents for recommender systems","venue":null,"work_id":"7d1b0f51-1aa1-4ce1-bc06-bf01c6e8c124","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:be32308c9e99887d391ae94a3cc75200e6e29bbe171560eb75a3f32b9b602260","observation_id":"8bc6d331-a311-48a7-bd55-f96ea70c9114","resolution":{"observed_at":"2026-05-17T15:31:55.821919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentcf++: Memory-enhanced llm-based agents for popularity-aware cross-domain recommendations","venue":null,"work_id":"18307fb6-0d27-47a7-a78b-7db15620dced","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:bb54d97c540e68eb352cca66758e227871795b81f359a5b812b460d1d1733bf7","observation_id":"67d6453c-12cb-4168-a772-dfbe4c7c8125","resolution":{"observed_at":"2026-05-17T15:31:55.798096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18413","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-agent collaborative filtering: Orchestrating users and items for agentic rec- ommendations","venue":null,"work_id":"3df4c571-0c91-480c-999a-ecc78e59193d","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:d6a1593250fc479b18e93ec6a09814937aa76b77265659100d40caafc701e3eb","observation_id":"c6c01178-2781-4371-a4e7-aa3f7f6f528f","resolution":{"observed_at":"2026-05-11T08:56:02.232542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21609","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recnet: Self-evolving preference propagation for agentic recommender systems.arXiv preprint arXiv:2601.21609","venue":null,"work_id":"d2a6f635-007c-48b7-8070-125aacb8e0d1","year":2026},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:d6a6e8714c3c7053e0fb403da9ba3c6a8872d17a3547eb692b34927993872719","observation_id":"22b2884f-a43b-4317-89cc-049ce1ff0cfb","resolution":{"observed_at":"2026-05-11T08:56:02.204406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:29f3e6fe2799821ccaaa89faa0b2b342afc668f31be6b45f68c0e9c49c25e2e7","observation_id":"aa7799e6-5e29-4d17-b41e-e2cf8e40e283","resolution":{"observed_at":"2026-05-11T08:56:02.187439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":19,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2604.10029."}