{"as_of":"2026-08-09T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95885e842e937c7fc114097cd8bfe6b886d3fcd9cb388b3c51230bd9e30a27ad","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:56.255061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:34:57.712764Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T15:26:56.255061Z","title":"arXiv preprint arXiv:2503.15478 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-08-09T16:48:59.094466Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:56.255061Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.15146"},"observation_digest":"sha256:8a268b97cf478be321ebeb928bb72856a07c48f5fc02a13b63d126ecf246b940","observation_id":"14a9e272-3755-4f82-8ebb-4c5d0b603de9","resolution":{"observed_at":"2026-08-07T15:26:56.255061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T15:07:10.796768Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.796768Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:6d4f9c4ceb4ae95c3822bb546875cf82104ea5cbd2f7c8a9cc52bd92017cd1ce","observation_id":"b169f929-fb11-4c83-8be7-a284473d8032","resolution":{"observed_at":"2026-08-07T15:07:10.796768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T14:44:31.351435Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17716","last_updated":"2025-05-23T10:33:14Z","snapshot_observed_at":"2026-08-08T15:42:18.320838Z","submitted_at":"2025-05-23T10:33:14Z","title":"Get Experience from Practice: LLM Agents with Record & Replay","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:31.351435Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.17716"},"observation_digest":"sha256:046a87f92837cfcf4ded3e6a5893a7a527b97ba7ffec85f2bff7db98b7e5bfb5","observation_id":"73ce5631-804b-42e7-a0dc-7ac9d5f4e945","resolution":{"observed_at":"2026-08-07T14:44:31.351435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T13:52:59.729856Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-07T13:45:29.055916Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:59.729856Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.20732"},"observation_digest":"sha256:9b8cf9dfc5c6f06cbf7ac0460db9ea9e74c5fae39543ca645875316f218afad6","observation_id":"b6dca655-ce83-4790-b963-216ffd7ff111","resolution":{"observed_at":"2026-08-07T13:52:59.729856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T12:42:35.042447Z","title":"SWEET- RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23885","last_updated":"2025-06-11T01:42:53Z","snapshot_observed_at":"2026-08-07T22:31:50.319614Z","submitted_at":"2025-05-29T17:51:58Z","title":"OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:35.042447Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.23885"},"observation_digest":"sha256:52a45acd584594d08ad41a68d0af7314605f91c0e2ba1f89844a91c20ff552e7","observation_id":"1454204d-6f50-4207-9c68-4aac41fc2c92","resolution":{"observed_at":"2026-08-07T12:42:35.042447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T12:27:52.419144Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-08T15:41:55.383976Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.419144Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:e9d3ae7eb145908694a8e52332e96571e21ffa6a19d33dffd591073ca4384d37","observation_id":"4f807b02-017d-4bed-a1be-c32a4eab9262","resolution":{"observed_at":"2026-08-07T12:27:52.419144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T12:09:01.135410Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:01.135410Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:baca21a23b80db70863397a5c62ae9b7c05c77b722ad67a866e125c7830895b0","observation_id":"125d7087-241d-4a98-9ab3-b3ac2c9313c8","resolution":{"observed_at":"2026-08-07T12:09:01.135410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T11:40:58.657810Z","title":"get_reservation_details","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-08-08T08:13:29.225328Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:58.657810Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2506.01716"},"observation_digest":"sha256:4be90fb8b2150c02f7882792150d8092eb2687a754f115051d0503ec2c7e5b13","observation_id":"17e33e8c-9b01-4cc9-a34c-5da8a28ac835","resolution":{"observed_at":"2026-08-07T11:40:58.657810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T11:32:30.314881Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-09T00:47:31.746531Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:30.314881Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:a66bb202385c383626980e6e56a9ae9d47298c5f5bf3dd9b6309bba34204cc66","observation_id":"3d37a5d8-7487-4031-94a2-c63c0b08b245","resolution":{"observed_at":"2026-08-07T11:32:30.314881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T04:39:39.160869Z","title":"PAG 15 eval w/o verifier,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-08T09:07:12.052492Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:39.160869Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2506.10406"},"observation_digest":"sha256:110ccdc81ef7a6b38d6926aca4878f98c745d9db215de98790d43edc91e21c02","observation_id":"7625a69a-a765-439d-8c35-df5ee4ddd1c3","resolution":{"observed_at":"2026-08-07T04:39:39.160869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-06T20:01:45.270627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04099","last_updated":"2025-07-15T16:49:25Z","snapshot_observed_at":"2026-08-08T20:05:59.077948Z","submitted_at":"2025-07-05T16:49:34Z","title":"Conversation Forests: The Key to Fine Tuning Large Language Models for Multi-Turn Medical Conversations is Branching","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:45.270627Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2507.04099"},"observation_digest":"sha256:693186d43e74d6334d5ea07a8933fe877b182374077afbc5cc77358c9cb48deb","observation_id":"1f0dc4f4-f5e2-4c7e-91bb-808ff5e823e3","resolution":{"observed_at":"2026-08-06T20:01:45.270627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-06T18:13:00.021058Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.021058Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:a7665ddbcf1ff63d995cbe042e02774aa66b0aa5e6b88a8c77fda0ce0f11f5bb","observation_id":"633bb555-fc2c-4003-9188-8f313ed67ce6","resolution":{"observed_at":"2026-08-06T18:13:00.021058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-06T17:11:22.785205Z","title":"cc/paper_files/paper/2024/file/ c848b7d3adc08fcd0bf1df3101ba6728-Paper-Conference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11633","last_updated":"2025-07-15T18:13:04Z","snapshot_observed_at":"2026-08-08T15:30:21.833675Z","submitted_at":"2025-07-15T18:13:04Z","title":"General Modular Harness for LLM Agents in Multi-Turn Gaming Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:11:22.785205Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2507.11633"},"observation_digest":"sha256:475dd1de3be2c9b736a6c75509dba694605fba1f85927a9f2e796516fed56578","observation_id":"dd58bca8-26d4-4d0c-b6ab-e0f0866f15b4","resolution":{"observed_at":"2026-08-06T17:11:22.785205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:682644850e8ff73f028916dc68962ab89f06aae11ab457a7762e66e782292ce1","observation_id":"aa65f488-02e3-49d7-8feb-539207c4b1eb","resolution":{"observed_at":"2026-05-18T19:21:48.728989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:5ae821fe500345829b3b9e664be38cacd672e3b07e5bcbdb6f4d2a0f4057ee40","observation_id":"df998f68-4a2b-44f7-8386-e11527426948","resolution":{"observed_at":"2026-05-18T05:30:55.226541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2511.00413","last_updated":"2026-04-23T16:13:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-01T05:56:49Z","title":"Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T02:04:46.559881Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2511.00413"},"observation_digest":"sha256:f90f20f3899cdbbe9a2bb84cd9dc9bcaac4ab4be61b47d3df30fe227758da95c","observation_id":"43c7aad6-49c0-49e6-906c-976e2360c91e","resolution":{"observed_at":"2026-05-18T02:05:39.034862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-03T14:34:51.341451Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20111","last_updated":"2026-06-04T03:41:38Z","snapshot_observed_at":"2026-08-03T14:34:47.811827Z","submitted_at":"2025-12-23T07:11:26Z","title":"ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T14:34:51.341451Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2512.20111"},"observation_digest":"sha256:24200a7c3f729971f73b0793a0d5f176e36a0f28503bcbd1eea9503fc0bfdb09","observation_id":"1a6179a0-be0e-4fec-a489-4edb3cfde94d","resolution":{"observed_at":"2026-08-03T14:34:51.341451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:685b0f1eeb894c19b2db621c9ca3e43d2a5108c691797c004dc7aa1e8f3f2e9f","observation_id":"d137f4c8-ea46-414d-83e9-9e000525dd33","resolution":{"observed_at":"2026-05-17T15:14:26.300750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2602.06475","last_updated":"2026-05-13T09:12:10Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-06T08:03:11Z","title":"Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T07:21:01.335414Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2602.06475"},"observation_digest":"sha256:d5d30707eb48896241cc5c6243a3f09e346481d41567da39d5801b977019a872","observation_id":"1a126558-2aa2-41fa-822f-bb3b714ebddb","resolution":{"observed_at":"2026-05-16T07:22:31.136212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2604.02869","last_updated":"2026-04-03T08:36:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T08:36:03Z","title":"Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T19:51:50.503945Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2604.02869"},"observation_digest":"sha256:7de7782df87d8c29057f1429debe03fa683a3d78edcc769201af90d51087890b","observation_id":"04ab4af9-3fd6-40cc-b505-75a93ffb9a05","resolution":{"observed_at":"2026-05-13T19:53:11.529146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2604.05529","last_updated":"2026-04-10T06:44:09Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T07:28:20Z","title":"ActivityEditor: Learning to Synthesize Physically Valid Human Mobility","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:42:36.437661Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2604.05529"},"observation_digest":"sha256:6111eebbda95f4811fc309b21922a97aa5b80db7d9c58b26063a3202e4ba69c3","observation_id":"f3d42dab-7dce-4859-ac9e-c1ed570faaeb","resolution":{"observed_at":"2026-05-11T00:05:50.000162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2604.07645","last_updated":"2026-04-08T23:11:12Z","snapshot_observed_at":"2026-07-06T22:55:50.808914Z","submitted_at":"2026-04-08T23:11:12Z","title":"PRIME: Training Free Proactive Reasoning via Iterative Memory Evolution for User-Centric Agent","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:59.156121Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2604.07645"},"observation_digest":"sha256:9488cab41830859ec9ac88e8920d4b8ef149c8dcb041dd24793609517e723632","observation_id":"26c3d4ed-4455-4ae1-9410-e2bf0424da5c","resolution":{"observed_at":"2026-05-11T07:06:11.230632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2604.27955","last_updated":"2026-04-30T14:51:49Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:51:49Z","title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-07T05:48:00.486572Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2604.27955"},"observation_digest":"sha256:10c695098f111f4c8684b1f5a1f0a596d4e33dacaec995f1388f43b01e05489e","observation_id":"a0fdffef-ee8e-439a-865e-3d2bcf9dfcf6","resolution":{"observed_at":"2026-05-12T10:31:29.471183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2605.08334","last_updated":"2026-07-29T00:50:03Z","snapshot_observed_at":"2026-08-02T18:36:13.233377Z","submitted_at":"2026-05-08T17:59:23Z","title":"CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:57.796883Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2605.08334"},"observation_digest":"sha256:ab93013136a5a43407d7f18d02ef1e2ead5021deef9f04e4493578821eb82c88","observation_id":"11058383-d232-4920-a4e6-e116d4043f25","resolution":{"observed_at":"2026-05-12T08:41:24.049413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-02T14:37:24.690196Z","title":"100% organic cotton","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08334","last_updated":"2026-07-29T00:50:03Z","snapshot_observed_at":"2026-08-02T18:36:13.233377Z","submitted_at":"2026-05-08T17:59:23Z","title":"CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T14:37:24.690196Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2605.08334"},"observation_digest":"sha256:bc80053cff04d4e2183cd04199b8885966990b25327d93e3d4f5e66f86b29c63","observation_id":"3390848c-dd81-46ca-98fc-9a18b501fb71","resolution":{"observed_at":"2026-08-02T14:37:24.690196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2605.10674","last_updated":"2026-05-11T14:55:20Z","snapshot_observed_at":"2026-08-05T06:43:24.460490Z","submitted_at":"2026-05-11T14:55:20Z","title":"Step Rejection Fine-Tuning: A Practical Distillation Recipe","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T03:44:33.525966Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2605.10674"},"observation_digest":"sha256:5351a23b770ea40c2bf87c1517a4215fe91b2d0586be908a97c2966c9aacef70","observation_id":"b9ad27e3-ca85-4d65-96da-dcefaabc01cb","resolution":{"observed_at":"2026-05-12T07:06:35.455960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-05T23:10:42.483401Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T10:41:25.205368Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:caa3b809bdc2ec5eafa522a4977a4525d2c6d57e5e515b7acc20746a0a79e947","observation_id":"754fb7ba-0268-41af-9679-6dd5bcb6f288","resolution":{"observed_at":"2026-05-20T10:43:12.469797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-03T02:23:32.483381Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-05T23:10:42.483401Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T02:23:32.483381Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:7be6e3419be36b908fff50cf43605ad0f108f46bd181b0de71b05f84f10d9cf9","observation_id":"7e2d00a5-471e-438c-94c9-204a55df7b01","resolution":{"observed_at":"2026-08-03T02:23:32.483381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2605.22240","last_updated":"2026-06-03T09:01:29Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:46:25Z","title":"Unlocking Proactivity in Task-Oriented Dialogue","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T05:31:37.171422Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2605.22240"},"observation_digest":"sha256:54c77105596b9050eeeb2dd39916abd6d5416aa3cd05154adc5139bbae1928f8","observation_id":"f5193e78-721e-4d63-849f-01c0f30ae694","resolution":{"observed_at":"2026-05-22T05:34:40.521037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2503.15478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-06-30T17:34:57.712764Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":"7bec1034-d193-4a7e-9ffc-5caa0ac1c47e","year":2025},"citing_paper":{"arxiv_id":"2605.22240","last_updated":"2026-06-03T09:01:29Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:46:25Z","title":"Unlocking Proactivity in Task-Oriented Dialogue","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:11.074231Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2605.22240"},"observation_digest":"sha256:89dba830c54e3282719207d3bbe86c5de203daf539bbe3558123b3b279e6d842","observation_id":"8d6e6666-2b71-4cb6-b8a8-6c70dc737ad5","resolution":{"observed_at":"2026-06-30T17:34:57.714454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-02T07:36:55.011277Z","title":"SWEET-RL : Training multi-turn LLM agents on collaborative reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:55.011277Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:7df4d31cb8d6d7b1b034826e0975928f12f648f50256f6be0220d8e0cf346a12","observation_id":"2e6c0734-d37c-44a7-ab34-e99e658384e5","resolution":{"observed_at":"2026-08-02T07:36:55.011277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-01T06:17:30.431790Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21971","last_updated":"2026-07-24T04:35:29Z","snapshot_observed_at":"2026-08-08T03:29:18.543567Z","submitted_at":"2026-07-24T04:35:29Z","title":"Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T06:17:30.431790Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2607.21971"},"observation_digest":"sha256:8db98208038dfdf6897f49877150be3ce835ca184ea408cc51c187741a819f52","observation_id":"fb439d78-5096-4625-ab82-618defb3f50a","resolution":{"observed_at":"2026-08-01T06:17:30.431790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-01T02:44:33.291734Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-09T19:01:47.867945Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.291734Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:001cf95f831f71365183308829e246d84b2b89be32e3053c89c16ba4ba30c4ec","observation_id":"0188d5a1-8c76-42b0-9bc7-0a7d4b590917","resolution":{"observed_at":"2026-08-01T02:44:33.291734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-04T23:23:14.690152Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-09T13:33:19.122605Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.690152Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:a9167d8cbe1866b65509c9728b4d103c02f4acbdc31a108b4cd5d0527b609a5a","observation_id":"29aec9b2-098f-4024-ada1-5ec02895ecfb","resolution":{"observed_at":"2026-08-04T23:23:14.690152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.15478/citation-record","integrity":"/paper/2503.15478/integrity","json":"/paper/2503.15478/citation-record.json","paper":"/paper/2503.15478"},"outbound":[],"paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2503.15478."}