{"as_of":"2026-08-09T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48a3b5a3d36e0f8492cd8a801ca9ebf83cbed106e6ace9ed89929f39708c714f","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:10:51.670313Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:23:14.662916Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T23:23:14.803053Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2607.13988","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.13988","snapshot_observed_at":"2026-08-04T23:23:14.803053Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","venue":"cs.LG","work_id":"34423d6d-5805-43ab-a6f5-048193bba47f","year":2026},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.662916Z"},"links":{"cited_paper":"/paper/2607.13988","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:149457a932e961255352b089420e8849c4a3d7965864a5a1c182dd41f88ebee2","observation_id":"344e4dc4-f6fc-4f6f-a7eb-7302855a467e","resolution":{"observed_at":"2026-08-04T23:23:14.809554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.13988/citation-record","integrity":"/paper/2607.13988/integrity","json":"/paper/2607.13988/citation-record.json","paper":"/paper/2607.13988"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13651","last_updated":"2025-06-16T16:16:14Z","snapshot_observed_at":"2026-08-08T21:36:50.159357Z","submitted_at":"2025-06-16T16:16:14Z","title":"xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13651","snapshot_observed_at":"2026-08-02T03:10:51.504547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.504547Z"},"links":{"cited_paper":"/paper/2506.13651","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:4f5a3e115f27a373ddebcd238de467e489232212cf28fe9ead190082b167d525","observation_id":"f21c86e2-fb41-4351-90c9-0a41ce7883ce","resolution":{"observed_at":"2026-08-02T03:10:51.504547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-02T03:10:51.514445Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.514445Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:a045833e0a2c1de910bfac8551808e7117a73ce25bf22c646311dac5e2068306","observation_id":"f73e6d76-0cd4-4ce0-ae26-c611a18fbd3d","resolution":{"observed_at":"2026-08-02T03:10:51.514445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.519075Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.519075Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:64d6dfdf20f7ae41aa51a95504bd5d51c321fe9a9187c7f4c8f2818418cc4364","observation_id":"9c6713de-62f7-4e67-a628-77c57601c653","resolution":{"observed_at":"2026-08-02T03:10:51.519075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.523255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.523255Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:984bc2d81a7fcbee4e516f32fba7441291d4aee5f5ff59e0949bb43b06c112a8","observation_id":"205c024e-c1ec-4be4-bfb0-36357f6de419","resolution":{"observed_at":"2026-08-02T03:10:51.523255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07164","last_updated":"2025-04-09T17:55:19Z","snapshot_observed_at":"2026-08-07T16:07:06.150702Z","submitted_at":"2025-04-09T17:55:19Z","title":"R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07164","snapshot_observed_at":"2026-08-02T03:10:51.528187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.528187Z"},"links":{"cited_paper":"/paper/2504.07164","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:cc40943a7924d26197d964ad242d0bd3b8522b8c5b7cb676c82f3b1849b6064e","observation_id":"7b01ea83-05d3-4bb3-a946-884540eef88f","resolution":{"observed_at":"2026-08-02T03:10:51.528187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-09T04:26:25.608959Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-02T03:10:51.532947Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.532947Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:07b45a267781edb20d427a02889d441aeafd004334bc9e1840d678b9f55a537f","observation_id":"fe7c2143-8f14-4272-87fe-6dcc857aabba","resolution":{"observed_at":"2026-08-02T03:10:51.532947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-09T01:03:55.193390Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-02T03:10:51.537374Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.537374Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:583f728de2f10a5bd18aecce0bb375029599686f0b27170619448dcd0acbc21e","observation_id":"5d5f25e4-d7ea-466e-9319-ab5f1dd8c5d3","resolution":{"observed_at":"2026-08-02T03:10:51.537374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-02T03:10:51.541964Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.541964Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:e7058f6588ecae754eb16418eccde953878d938ca71520250bb36086b7d5ed9c","observation_id":"eca1964b-ea13-408a-ae1c-5b25746d26d5","resolution":{"observed_at":"2026-08-02T03:10:51.541964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-02T03:10:51.550887Z","title":"Nakano, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.550887Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:8ac85e22036cdbdc72c5255720259fc7af598ffbdc0e38b8bda9078421515ab0","observation_id":"db9c136a-5340-4fc8-96ad-edeffac6f133","resolution":{"observed_at":"2026-08-02T03:10:51.550887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12373","last_updated":"2024-07-16T06:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T07:58:33Z","title":"WebCanvas: Benchmarking Web Agents in Online Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12373","snapshot_observed_at":"2026-08-02T03:10:51.555037Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.555037Z"},"links":{"cited_paper":"/paper/2406.12373","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:3c68d69cb224364b63283ed3630bfd89a2eb23e51ceac005d8dd20e49fd72ba0","observation_id":"f1c36c4f-a132-4663-99ac-4466b198786c","resolution":{"observed_at":"2026-08-02T03:10:51.555037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-02T03:10:51.559083Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.559083Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:0257cd13e5072d008c3ca14543be74bd4eaed0cfadb13b90e33f4096afa39bf2","observation_id":"ddf29d8b-df17-406d-8ace-795cdff9af3c","resolution":{"observed_at":"2026-08-02T03:10:51.559083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11120","last_updated":"2025-01-09T11:39:32Z","snapshot_observed_at":"2026-08-07T05:42:24.837726Z","submitted_at":"2024-12-15T08:51:14Z","title":"Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11120","snapshot_observed_at":"2026-08-02T03:10:51.564249Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.564249Z"},"links":{"cited_paper":"/paper/2412.11120","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:485c8fbefc43b4db741dc1edb71441b187728610a717e7a686452ff78683a128","observation_id":"36014a80-2955-4406-be10-e95963b257ce","resolution":{"observed_at":"2026-08-02T03:10:51.564249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-02T03:10:51.568458Z","title":"Rawles, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.568458Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:4d7e0f536721995a9b1d4d0c914c8b408637fcda484a93f0d7dc961f45fcf5ab","observation_id":"6df697c2-8b11-4e9f-a747-90d051749517","resolution":{"observed_at":"2026-08-02T03:10:51.568458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T03:10:51.573315Z","title":"Schulman, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.573315Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:b06d9b864355a854672f1a44d0481c5b92863145def1a3cf2cbd8e5eb4a4df3e","observation_id":"b6fecf0b-61e0-446b-868a-2c9019b23f4a","resolution":{"observed_at":"2026-08-02T03:10:51.573315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-02T03:10:51.577885Z","title":"Setlur, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.577885Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:8696d4430feaf3bf1490975e069e7eb04dfbb7218511ba354f00d0328dca9ded","observation_id":"0668243f-b7a8-418c-b483-cd30bab93933","resolution":{"observed_at":"2026-08-02T03:10:51.577885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T03:10:51.581899Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.581899Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:bc75747e45422ed5894e62c223ad88306083bc203f6192c972c0f460f81d148b","observation_id":"5210b9de-fd48-4c7b-af8f-257af5a6c803","resolution":{"observed_at":"2026-08-02T03:10:51.581899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-02T03:10:51.586270Z","title":"Shinn, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.586270Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:2dfec47b0488c1b4d890b0e1e4c166cacede6fc63eb32542057ee7b8d0b18fc2","observation_id":"8668f7ce-d362-405f-b796-e58bf922a197","resolution":{"observed_at":"2026-08-02T03:10:51.586270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-02T03:10:51.590861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.590861Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:32a66a8ba6de63335ef80b20f1bb095c6b954b8803c7d6a032015ab3a93fd798","observation_id":"db20d725-16fc-4756-8dff-c428a55c28e6","resolution":{"observed_at":"2026-08-02T03:10:51.590861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-02T03:10:51.595241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.595241Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:5b64a8e9d4b7fb281f25da4ce3766fcd3b6fcc0ee65d62364f8253178998970a","observation_id":"9aa12024-a25e-4e43-98da-c46e8c6782fd","resolution":{"observed_at":"2026-08-02T03:10:51.595241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24701","last_updated":"2026-05-18T04:10:32Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:53:02Z","title":"Tongyi DeepResearch Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.24701","snapshot_observed_at":"2026-08-02T03:10:51.602824Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.602824Z"},"links":{"cited_paper":"/paper/2510.24701","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:e771ee5bea94757ddc0705976804ec86487e65651060dfa914a3203b12b5cdb1","observation_id":"2dd274b2-41b4-4893-bfd7-fbfea6ab602e","resolution":{"observed_at":"2026-08-02T03:10:51.602824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-02T03:10:51.607019Z","title":"Uesato, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.607019Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:4f6d6bf9d5c4be9f25094580dcd7a05943797a5bbe6d45214cfa2da1b3114dc8","observation_id":"0626a104-8a73-416e-ad0f-7c545f9ba511","resolution":{"observed_at":"2026-08-02T03:10:51.607019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-09T01:39:11.956106Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-02T03:10:51.616187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.616187Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:7955e7eed0dd701d599c1856cdf5dc40508e085a87ab3669d84fde20971b4d8c","observation_id":"ea196cc6-889b-4372-ac6e-50370063138b","resolution":{"observed_at":"2026-08-02T03:10:51.616187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21768","last_updated":"2026-05-20T22:02:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T22:02:00Z","title":"Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21768","snapshot_observed_at":"2026-08-02T03:10:51.620840Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.620840Z"},"links":{"cited_paper":"/paper/2605.21768","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:3132c15b3525f1144b10820b9dacca924d2c6a8731724f545f7cc7927006607a","observation_id":"06b7549d-5b6a-442e-a256-bac21fa3aea6","resolution":{"observed_at":"2026-08-02T03:10:51.620840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T03:10:51.624897Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.624897Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:0c471890291dd4330755b1bb637022e71d83a0b99b663a0bf09949ecd228ccfc","observation_id":"de5ac6b2-5944-4264-9278-b9116f52d45d","resolution":{"observed_at":"2026-08-02T03:10:51.624897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-02T03:10:51.628833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.628833Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:cc08c9d48e0fd7adf7e7b6e5b13d4438d0196814ceb8cc9202ff473129d4fd84","observation_id":"b368e4a0-6da4-476e-ab01-3a1481441569","resolution":{"observed_at":"2026-08-02T03:10:51.628833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.632686Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.632686Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:1af7e9156e958ee48bed7710628f596ff86103c3a5acbc55c71bab2dfeeb6cda","observation_id":"e2d46ae3-7b17-4cff-a041-dbfd573a0dc6","resolution":{"observed_at":"2026-08-02T03:10:51.632686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03403","last_updated":"2026-05-15T21:29:46Z","snapshot_observed_at":"2026-07-06T22:23:00.681940Z","submitted_at":"2025-09-03T15:28:51Z","title":"Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.03403","snapshot_observed_at":"2026-08-02T03:10:51.636722Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.636722Z"},"links":{"cited_paper":"/paper/2509.03403","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:80dd0ce380fea676178f2c37a8902b7ddd1c48c11c89167642b4c132def4ad73","observation_id":"a2d4769b-f6df-498a-a643-760a44d83a51","resolution":{"observed_at":"2026-08-02T03:10:51.636722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-06T03:48:05.506841Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-02T03:10:51.640636Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.640636Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:0232ed166d5e04b83ccc223129f8c4d90d7d73a09786c0821049ce2c9810ea45","observation_id":"28bdb2ca-b582-4aa4-96d8-2fc7fe070402","resolution":{"observed_at":"2026-08-02T03:10:51.640636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-07T22:31:11.195198Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-02T03:10:51.645371Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.645371Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:79adc9946051fa812c4cc66a10cc970ae27b97a46cb54717e66d3dd56e28bd63","observation_id":"84450d16-3158-487c-a59b-c3a2249d38b2","resolution":{"observed_at":"2026-08-02T03:10:51.645371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-04T19:11:48.797552Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-02T03:10:51.649959Z","title":"Zhang, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.649959Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:89cc6fd24a87933283086ffcde159e0645cacd6171b10de588bd810c90be85e1","observation_id":"70dade9b-c088-4898-b2ed-d25004e24f77","resolution":{"observed_at":"2026-08-02T03:10:51.649959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.654620Z","title":"Zhang, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.654620Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:9d284708a417db53cb9001d3cb93656bfd6a6b2f536c59793c39fa19e4677e54","observation_id":"8a792367-ef91-4ae3-8638-051ccff89d0c","resolution":{"observed_at":"2026-08-02T03:10:51.654620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-02T03:10:51.659361Z","title":"Zheng, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.659361Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:adb3d041a6d0f4122f2f1181b97e79bbe4936a727acec6d9d1ffcb86e78ca42b","observation_id":"1111c82e-4abf-44cd-a07e-b9c6cf50c318","resolution":{"observed_at":"2026-08-02T03:10:51.659361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.663804Z","title":"at the Jakarta Expo Boxing Hall","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.663804Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:5a49e9c517d0c3c09539548c139d8d8700c1f871b9c73d4742d8361bae24a4d4","observation_id":"a88927cf-ac3a-4722-93ab-cf50b951a53b","resolution":{"observed_at":"2026-08-02T03:10:51.663804Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.670313Z","title":"influxdata company name change from early 2010s to later name","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.670313Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:aa918356d8c3ce1e43cda42dd0770440fd950f0131cabbcb7e024c2a9bb72aec","observation_id":"db19753c-bdb6-48ea-ab61-d39caa622bdd","resolution":{"observed_at":"2026-08-02T03:10:51.670313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.599182Z","title":"Tan, X.-W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.599182Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:4a303211cf855ff62eef806915da0dbfa59c5a648a29438b32e941a861f45ef2","observation_id":"25a870da-d1a6-4645-97e1-b2f99bbfada5","resolution":{"observed_at":"2026-08-02T03:10:51.599182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-07T13:45:29.055916Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-02T03:10:51.611387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.611387Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:b76af0ff821f3d17f435e36e34437d3a6a17d89459dbaef2bc7f3dfd4284754f","observation_id":"74c730fc-3178-4f5e-97f1-0176e0f8fc29","resolution":{"observed_at":"2026-08-02T03:10:51.611387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-02T03:10:51.509228Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.509228Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:d4d7684ff8e7b7c571cee0399879a2abcb58e2319de1208b7ad4fcf3ba8dda1f","observation_id":"a6de5c47-ed61-469e-a188-460913426f03","resolution":{"observed_at":"2026-08-02T03:10:51.509228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.493672Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.493672Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:8304c3a72577412d19775b3f1e8da90c9a13b4c041ff22c5f3c6d03dea5b614a","observation_id":"b7ec7ad2-4275-476e-8f7b-7e0c14e056df","resolution":{"observed_at":"2026-08-02T03:10:51.493672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:51.499866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.499866Z"},"links":{"citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:c7375f4c6e1b3cb5a29b7b579d7c7f6157a374e21a5b2e60ee2ba320b08cda8e","observation_id":"09568c4b-06bc-4695-b267-50ef40445613","resolution":{"observed_at":"2026-08-02T03:10:51.499866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-02T03:10:51.546216Z","title":"Lightman, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.546216Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:97e4040ed48fcd699dc2ae7fb0a25152059d8da5dbf32b4d305eb5ac253b1ea0","observation_id":"61784b62-6e4f-4ba1-904f-038bf903a1b3","resolution":{"observed_at":"2026-08-02T03:10:51.546216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T08:46:44.738945Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2607.13988."}