{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:EN3VTK7EJSECEXUVEFNPK6X7BM","short_pith_number":"pith:EN3VTK7E","schema_version":"1.0","canonical_sha256":"237759abe44c88225e95215af57aff0b23d368a03792eb30a06f746a1e3feccb","source":{"kind":"arxiv","id":"2608.08255","version":1},"attestation_state":"computed","paper":{"title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Anxiang Ma, Chenglong Wang, Jingbo Zhu, Peinan Feng, Qiaozhi He, Shunjie Xing, Tongran Liu, Tong Xiao, Yan Ding, Yifu Huo, Yuxin Gao","submitted_at":"2026-08-08T17:32:34Z","abstract_excerpt":"Agentic reinforcement learning (RL) often suffers from delayed and sparse rewards in real-world environments. A promising solution to this challenge is credit assignment, which aims to decompose trajectory-level rewards and provide more fine-grained supervision for intermediate decisions. However, existing credit assignment approaches ignore the rich process information naturally generated during environment interaction, e.g., interaction history. We argue that such information provides valuable supervision for identifying the contribution of individual actions. To this end, we propose Environ"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2608.08255","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2026-08-08T17:32:34Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"c797a27ace9657802366a8f352408924b116b140d857032d8daa6c39aa123537","abstract_canon_sha256":"263bfd7da96c979a2b3492352ac20ac413044460db11c3815bbceda50cc4caec"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-11T01:22:08.047598Z","signature_b64":"9kU8jFMtuwtsssDZ+djvd2REeoZ9gI9DftZseezlow8qF9+AzIjHTL0d56tCI0epsmBaFzoGBedc5hn+0cB+CQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"237759abe44c88225e95215af57aff0b23d368a03792eb30a06f746a1e3feccb","last_reissued_at":"2026-08-11T01:22:08.045019Z","signature_status":"signed_v1","first_computed_at":"2026-08-11T01:22:08.045019Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Anxiang Ma, Chenglong Wang, Jingbo Zhu, Peinan Feng, Qiaozhi He, Shunjie Xing, Tongran Liu, Tong Xiao, Yan Ding, Yifu Huo, Yuxin Gao","submitted_at":"2026-08-08T17:32:34Z","abstract_excerpt":"Agentic reinforcement learning (RL) often suffers from delayed and sparse rewards in real-world environments. A promising solution to this challenge is credit assignment, which aims to decompose trajectory-level rewards and provide more fine-grained supervision for intermediate decisions. However, existing credit assignment approaches ignore the rich process information naturally generated during environment interaction, e.g., interaction history. We argue that such information provides valuable supervision for identifying the contribution of individual actions. To this end, we propose Environ"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2608.08255","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2608.08255/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2608.08255","created_at":"2026-08-11T01:22:08.045942+00:00"},{"alias_kind":"arxiv_version","alias_value":"2608.08255v1","created_at":"2026-08-11T01:22:08.045942+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2608.08255","created_at":"2026-08-11T01:22:08.045942+00:00"},{"alias_kind":"pith_short_12","alias_value":"EN3VTK7EJSEC","created_at":"2026-08-11T01:22:08.045942+00:00"},{"alias_kind":"pith_short_16","alias_value":"EN3VTK7EJSECEXUV","created_at":"2026-08-11T01:22:08.045942+00:00"},{"alias_kind":"pith_short_8","alias_value":"EN3VTK7E","created_at":"2026-08-11T01:22:08.045942+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM","json":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM.json","graph_json":"https://pith.science/api/pith-number/EN3VTK7EJSECEXUVEFNPK6X7BM/graph.json","events_json":"https://pith.science/api/pith-number/EN3VTK7EJSECEXUVEFNPK6X7BM/events.json","paper":"https://pith.science/paper/EN3VTK7E"},"agent_actions":{"view_html":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM","download_json":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM.json","view_paper":"https://pith.science/paper/EN3VTK7E","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2608.08255&json=true","fetch_graph":"https://pith.science/api/pith-number/EN3VTK7EJSECEXUVEFNPK6X7BM/graph.json","fetch_events":"https://pith.science/api/pith-number/EN3VTK7EJSECEXUVEFNPK6X7BM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM/action/storage_attestation","attest_author":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM/action/author_attestation","sign_citation":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM/action/citation_signature","submit_replication":"https://pith.science/pith/EN3VTK7EJSECEXUVEFNPK6X7BM/action/replication_record"}},"created_at":"2026-08-11T01:22:08.045942+00:00","updated_at":"2026-08-11T01:22:08.045942+00:00"}