{"as_of":"2026-08-09T02:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f391a5f39555125e310a6ca77215c57b6968c104d901605333c409ff8cbb5d30","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:23:14.694452Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01667/citation-record","integrity":"/paper/2608.01667/integrity","json":"/paper/2608.01667/citation-record.json","paper":"/paper/2608.01667"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:23:14.645199Z","title":"10 Xuefeng Li, Haoyang Zou, and Pengfei Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.645199Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:60fb1e7064837d55574518dc3bbebd087655e69a9c589ed487ceb6177f9ece5e","observation_id":"8b721a9c-415e-4ccb-a10e-af5f6890dec9","resolution":{"observed_at":"2026-08-04T23:23:14.645199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T23:23:14.653931Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.653931Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:dcd500a8526e99d951b3b43ae9586122ed9e823b8af2cd9a4a6c3be2b80e47bb","observation_id":"92693cd6-c1ba-428b-99a1-50faf8fae3ce","resolution":{"observed_at":"2026-08-04T23:23:14.653931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-05T20:36:54.358831Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-04T23:23:14.658329Z","title":"Agentic reasoning and tool integration for llms via reinforcement learning.arXiv preprint arXiv:2505.01441,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.658329Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:94a50be1dc1133b50495475a6b0c1d84ac0c36d41938677b30be65357c109e7f","observation_id":"a1b0240b-e3f3-48f3-9235-56130f21c21e","resolution":{"observed_at":"2026-08-04T23:23:14.658329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2607.13988","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.13988","snapshot_observed_at":"2026-08-04T23:23:14.803053Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","venue":"cs.LG","work_id":"34423d6d-5805-43ab-a6f5-048193bba47f","year":2026},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.662916Z"},"links":{"cited_paper":"/paper/2607.13988","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:149457a932e961255352b089420e8849c4a3d7965864a5a1c182dd41f88ebee2","observation_id":"344e4dc4-f6fc-4f6f-a7eb-7302855a467e","resolution":{"observed_at":"2026-08-04T23:23:14.809554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:23:14.922963Z","title":"Exploiting tree structure for credit assignment in reinforcement learning with large language models","venue":null,"work_id":"ca995ae0-d521-4847-bdcf-c8304045a545","year":2026},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.667862Z"},"links":{"citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:23a5b2153f634dbcfbea28d8f2cab36c0eee168d6bf25edc3bb233b92930d51d","observation_id":"b824a36a-6db2-479b-9853-46c1de6bd896","resolution":{"observed_at":"2026-08-04T23:23:14.927639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-04T23:23:14.671864Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.671864Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:fb781889ce7c37408cc09ac38e2a2ef663c86f57db402ca7e4f1f1512ced81bd","observation_id":"fdc7c8d9-5d4f-496c-a375-929f8d2adcdb","resolution":{"observed_at":"2026-08-04T23:23:14.671864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-04T23:23:14.676492Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn rein- forcement learning.arXiv preprint arXiv:2504.20073, 2025b","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.676492Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:07980f34ba23b341cad4c3eaf0f3d1d36687022101f1a9ff2b8fc329d2edf27e","observation_id":"a172f626-5a46-44ad-b41e-6b49a319ce06","resolution":{"observed_at":"2026-08-04T23:23:14.676492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:23:14.908523Z","title":"Rein- forcing multi-turn reasoning in llm agents via turn-level credit assignment","venue":null,"work_id":"448f1fd3-c256-4ece-938e-acbcbc266d62","year":2025},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.681238Z"},"links":{"citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:8488172c73aef0fbd605557b89878b8aff734650b2521c1797ce496c5060266c","observation_id":"efce9824-9194-48da-8992-39b850606df8","resolution":{"observed_at":"2026-08-04T23:23:14.912954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-07T15:59:20.025064Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-04T23:23:14.686054Z","title":"Nemotron-research-tool-n1: Exploring tool-using language models with reinforced reasoning.arXiv preprint arXiv:2505.00024,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.686054Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:dbca251eb48d156fc95ae198bb504a2ffe356d8adfdd7c3bf35f95f01bbbe78b","observation_id":"8ded1493-716c-4061-a89a-18136fec6c84","resolution":{"observed_at":"2026-08-04T23:23:14.686054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-04T23:23:14.690152Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.690152Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:f8cb6e9e380c1a855b51b1850d2bceb57c590c743be8fa404bf268f98927db86","observation_id":"29aec9b2-098f-4024-ada1-5ec02895ecfb","resolution":{"observed_at":"2026-08-04T23:23:14.690152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:23:14.694452Z","title":"At 2po: Agentic turn-based policy optimization via tree search.arXiv preprint arXiv:2601.04767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.694452Z"},"links":{"citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:c88f7d867b07b7fb72592fa7c18362288162d509b280bfe6a240f0bce53e85dd","observation_id":"2ba18ea4-ed78-43cd-bc54-deb51ad88f44","resolution":{"observed_at":"2026-08-04T23:23:14.694452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-08T15:31:54.736488Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-04T23:23:14.629933Z","title":"Reinforcement learning for long-horizon interactive llm agents.arXiv preprint arXiv:2502.01600, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.629933Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:6a37c21ab798423c601539bbf2ccc456871f4507d26ebd0886516990505b0679","observation_id":"74360757-7012-4b6a-9243-770addcc35bc","resolution":{"observed_at":"2026-08-04T23:23:14.629933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-07T15:21:20.850969Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-04T23:23:14.639942Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents.arXiv preprint arXiv:2505.15117, 2025a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.639942Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:852453390a0eebb4e6c3bdb7ca2544e1b3a9d45dd4c402e14a177dc3ad8fada5","observation_id":"3f450e9f-b910-4ae1-be33-eae85bac52ea","resolution":{"observed_at":"2026-08-04T23:23:14.639942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:23:14.937374Z","title":"Let’s verify step by step","venue":null,"work_id":"e20b2399-7f0a-4421-85bb-e6f8ae241d8e","year":2024},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.649732Z"},"links":{"citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:9f8f9828717147548d6570a8d00a5b809da60038195a03c6164bf6c6380812a6","observation_id":"ee6508c6-f791-4ad9-923b-8dccee513ef9","resolution":{"observed_at":"2026-08-04T23:23:14.941960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-08-04T23:23:14.635075Z","title":"Jiazhan Feng, Shijue Huang, Xingwei Qu, Ge Zhang, Yujia Qin, Baoquan Zhong, Chengquan Jiang, Jinxin Chi, and Wanjun Zhong","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.635075Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:1e357459af27cb7cc9821e65e3aa7f92fb3f56788609ca2d612aa908583e746b","observation_id":"9eac6ccf-3610-4ef0-9123-e2250fd1828d","resolution":{"observed_at":"2026-08-04T23:23:14.635075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2608.01667."}