{"as_of":"2026-08-07T10:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95d071ec7281316117bb4c6d3c7269938206da891fbfeea245269af097dd7315","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T04:48:26.776852Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05378","snapshot_observed_at":"2026-08-01T04:48:26.776852Z","title":"arXiv:2607.05378","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22448","last_updated":"2026-07-27T23:08:28Z","snapshot_observed_at":"2026-08-07T08:03:30.671396Z","submitted_at":"2026-07-24T16:10:21Z","title":"Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T04:48:26.776852Z"},"links":{"cited_paper":"/paper/2607.05378","citing_paper":"/paper/2607.22448"},"observation_digest":"sha256:fc5188e0475eb1c0f2b13bf603c4505b9dec2868637461d2a4e69c0c46d480f9","observation_id":"881ff980-e98d-4b97-a9c8-8046ec27c3da","resolution":{"observed_at":"2026-08-01T04:48:26.776852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05378","snapshot_observed_at":"2026-08-01T03:38:25.594637Z","title":"Compactionrl: Reinforcement learning with context compaction for long-horizon agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23124","last_updated":"2026-07-25T09:58:24Z","snapshot_observed_at":"2026-08-06T19:50:20.416891Z","submitted_at":"2026-07-25T09:58:24Z","title":"AgentOmnia: Scaling Agentic Models for Full-Scenario Applications","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-01T03:38:25.594637Z"},"links":{"cited_paper":"/paper/2607.05378","citing_paper":"/paper/2607.23124"},"observation_digest":"sha256:a5e2c853d3760ac11e940d5bde639b94dfe4a030e486a6c56c86e400dab914b8","observation_id":"50e24622-8465-421c-ac21-ea8a57905800","resolution":{"observed_at":"2026-08-01T03:38:25.594637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05378/citation-record","integrity":"/paper/2607.05378/integrity","json":"/paper/2607.05378/citation-record.json","paper":"/paper/2607.05378"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:db8a5ba46dba4b9857dc5dec78bdf0438118674d531a6ce6863c6bd2c372dcad","observation_id":"3e0b7f1f-21c6-4f78-b210-85ce19c6a25e","resolution":{"observed_at":"2026-07-07T14:03:48.710553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:139b2c5ff69a812ba2276ee20468efc34a7db56a9480237198becd0b8a606a72","observation_id":"a7927d0d-817a-4c0d-8243-53ec0a377332","resolution":{"observed_at":"2026-07-07T14:03:48.676493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:b8fcec352811d89e9a6dc932ea9fb174f6c2757825a7ff7da90ce629cc55ef8b","observation_id":"2a288b75-3e56-455b-8f45-c710aa0c68be","resolution":{"observed_at":"2026-07-07T14:03:48.664487Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:57e03a0ba6e1d329d7809f016be9e7d036898e51e6be51afe4ac987c8bfb60b4","observation_id":"023bb951-e804-417d-9340-f44cace5c373","resolution":{"observed_at":"2026-07-07T14:03:48.678559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":"2508.06471","doi":"10.48550/arxiv.2508.06471","metadata_source":"pith","pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","venue":"cs.CL","work_id":"5bb4e5d7-985e-431b-bb0d-75576cdc2950","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:93863b2454a01e85db100535033f56a152da2421c18ef97f70de1df8e0a1336a","observation_id":"045d7020-f785-4f0e-91f0-16c2aaa76866","resolution":{"observed_at":"2026-07-07T14:03:48.713654Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:03121cd8e2045ef44333600e932264552466f4c57f56f868538414b77f42d935","observation_id":"e6123da0-4012-48b2-8d19-fb1ac55d7222","resolution":{"observed_at":"2026-07-07T14:03:48.459093Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06839","last_updated":"2024-08-12T03:53:35Z","snapshot_observed_at":"2026-08-06T17:12:58.658176Z","submitted_at":"2023-10-10T17:59:58Z","title":"LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression","version":2},"cited_work":{"arxiv_id":"2310.06839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06839","snapshot_observed_at":"2026-07-10T01:36:44.274003Z","title":"Longllmlingua: Accelerating and enhancing llms in long context scenarios via prompt compression","venue":"cs.CL","work_id":"216713e7-eb05-4ec2-b67c-cd543ff0d117","year":2023},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2310.06839","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:d9102ddcf1e11122545e392b64f212699ced2d393d4c0f6e34ff05cd421ad3d2","observation_id":"2aa56711-e4d4-46a5-8abe-be2e62d0cd56","resolution":{"observed_at":"2026-07-07T14:03:48.697410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06727","doi":"10.48550/arxiv.2510.06727","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling llm multi-turn rl with end-to-end summarization-based context management","venue":"ArXiv.org","work_id":"2a054e4f-7f2b-4beb-abbf-161af30dfbb5","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:6150048ec565954bc290ebc71a0b85ab1a7469a299d723b9248af72fde0228a7","observation_id":"55055d7b-fee2-4555-b94a-908aaff47fc9","resolution":{"observed_at":"2026-07-07T14:03:48.682914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.159024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.159024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06727","doi":"10.48550/arxiv.2510.06727","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling llm multi-turn rl with end-to-end summarization-based context management","venue":"ArXiv.org","work_id":"2a054e4f-7f2b-4beb-abbf-161af30dfbb5","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:53b50edf127b8e6e4d4c3966e3ebd8ebb362604f1c951b6129ab4d644d3591b1","observation_id":"c7ff7ccf-8645-4c87-8cde-57fa11fcedee","resolution":{"observed_at":"2026-07-07T14:03:48.458893Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.159024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.159024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:b24da47d5d3376982c50d758d8d04cbc2446e041e6e4987302abc2b19ee97807","observation_id":"df19cf28-7086-41d6-9002-eb6addeb02d7","resolution":{"observed_at":"2026-07-07T14:03:48.685877Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-03T06:31:15.541423Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":"2310.08560","doi":"10.48550/arxiv.2310.08560","metadata_source":"pith","pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemGPT: Towards LLMs as Operating Systems","venue":"cs.AI","work_id":"2698f5ad-c84c-40ca-b839-0912dae10ba2","year":2023},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:25cbee06db842591f494a8572a1f33ad28767d62e90ddee7b481f58b6717d400","observation_id":"2b84c590-9e9f-48f7-825e-ef3cd51ff423","resolution":{"observed_at":"2026-07-07T14:03:48.693835Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:8303b2d1f6eb119320b3cbc3702903641426e668e658446be45335321523a7f1","observation_id":"e5c6f8f2-8623-4812-901f-ae9ee5edc6ad","resolution":{"observed_at":"2026-07-07T14:03:48.693952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:95930bcac6ebeb4d6e242ef80536d8a2a7296263ca506c6d4aae386267fe8960","observation_id":"c193882f-a41e-4693-97d3-6eb68216b44c","resolution":{"observed_at":"2026-07-07T14:03:48.700310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:c2e8950763fd3bbd6f2c4002e9450fab9a74f36109d975ff24b3804d0804a961","observation_id":"7b5a9f53-0e91-4fac-b2f2-5eeb8d8377a4","resolution":{"observed_at":"2026-07-07T14:03:48.455187Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11967","doi":"10.48550/arxiv.2510.11967","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling long-horizon llm agent via context-folding","venue":"ArXiv.org","work_id":"c93d775c-8bfb-4aa6-8d56-e76c073c0128","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:e030a6bfcc8e55674d28eae5f3ce9cb9dfcb1451aa3978173de76fc1441d368b","observation_id":"0cb92ccc-8750-4222-8b7b-396eba6f9d8e","resolution":{"observed_at":"2026-07-07T14:03:48.700572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:50:53.252918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:50:53.252918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:21c99ee4b8b6b0199c8c7815dd85b03badd5e7be7a383718908ee955c0f754b9","observation_id":"a8af86be-f3c9-4f83-8bdb-e65689f503f3","resolution":{"observed_at":"2026-07-07T14:03:48.666214Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13313","doi":"10.48550/arxiv.2509.13313","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Resum: Unlocking long-horizon search intelligence via context summarization","venue":"ArXiv.org","work_id":"f9804930-fb00-40fa-8093-298b7c196181","year":2026},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:100e55ba595225ec376a5c0f1ba31fc40c96384377ff91f4570e2dbc60a41824","observation_id":"ac13f391-c494-4674-8ae9-2517d8748159","resolution":{"observed_at":"2026-07-07T14:03:48.707305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.381844+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.381844+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13313","doi":"10.48550/arxiv.2509.13313","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Resum: Unlocking long-horizon search intelligence via context summarization","venue":"ArXiv.org","work_id":"f9804930-fb00-40fa-8093-298b7c196181","year":2026},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:35eb863afd7fa3fbd1d8993cb74eb03f1b4f3f015282bf5a2642bd5dec1c4ea0","observation_id":"874c9524-eb42-4c89-a0bf-5b3db07e460b","resolution":{"observed_at":"2026-07-07T14:03:48.448402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.381844+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.381844+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:56:06.449962Z","title":"Mobilerl: Online agentic reinforcement learning for mobile gui agents, 2025 a","venue":null,"work_id":"b9ce7279-e77b-46c4-8134-05b04c67920f","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:0d3ede3e3194f714b08d13ac6f96b8b2e3c81432a8144dbf30850bfe907c6fbe","observation_id":"799b7099-f76b-4e41-8096-63bf8c3c7a98","resolution":{"observed_at":"2026-07-07T14:03:48.661263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:df0bf8582c4aa21c7cdac4ba456ef9f26c97dda882d10df8d043b88fc84735f4","observation_id":"9204ddb4-64b8-4377-918b-0875d07f1c33","resolution":{"observed_at":"2026-07-07T14:03:48.703852Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T02:56:21.377033Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":"2503.01491","doi":"10.48550/arxiv.2503.01491","metadata_source":"pith","pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":"cs.LG","work_id":"b9f345a1-11ca-4214-b731-220afdbef297","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:ddcd71c6929ef0a24e5b9748dd42ff7b722828ba7226e8eed67c67b747cac9d6","observation_id":"6bbf5e80-5a18-4823-a0c3-2e3b10152ac7","resolution":{"observed_at":"2026-07-07T14:03:48.691291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T02:56:21.377033Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":"2503.01491","doi":"10.48550/arxiv.2503.01491","metadata_source":"pith","pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":"cs.LG","work_id":"b9f345a1-11ca-4214-b731-220afdbef297","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:4e15e4f038b31d8acdff904acbc2a8fddf153a0aced7ff316de83e2f1cd45626","observation_id":"b0504468-7755-4dd9-a45f-4f2ae2ccb475","resolution":{"observed_at":"2026-07-07T14:03:48.463323Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:dfa70b5df5bfa207d732a1ce8ffe6ca7583934e606509855dff0d6f8efcf61d8","observation_id":"fc0fbd2b-181a-47c9-86f7-6ca5775ab26b","resolution":{"observed_at":"2026-07-07T14:03:48.705471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15841","last_updated":"2025-07-17T08:53:48Z","snapshot_observed_at":"2026-08-04T10:58:41.179508Z","submitted_at":"2025-06-18T19:44:46Z","title":"MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents","version":2},"cited_work":{"arxiv_id":"2506.15841","doi":"10.48550/arxiv.2506.15841","metadata_source":"pith","pith_arxiv_id":"2506.15841","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents","venue":"cs.CL","work_id":"43cfa793-fb98-4501-8224-4dfb9e56285c","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-07T13:57:33.821970Z"},"links":{"cited_paper":"/paper/2506.15841","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:082a61d56cdb26c5aae7f24c871ef52da4b6464f73285e9fcb28b73ddff7dac8","observation_id":"0a88d4ce-846d-43ce-9970-23ab6f4a0469","resolution":{"observed_at":"2026-07-07T14:03:48.688465Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2607.05378."}