{"as_of":"2026-08-08T02:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:209eb7fdfffa7f5facdbf6ddd7d7d553393683d3003d03012fb42279b4ffa0df","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:29:01.480681Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:48:09.620197Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:20:07.648363Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-08-04T09:48:09.620197Z","title":"Harnessing uncertainty: Entropy-modulated policy gradients for long-horizon llm agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13554","last_updated":"2026-06-08T06:02:10Z","snapshot_observed_at":"2026-08-04T09:47:55.188440Z","submitted_at":"2025-10-15T13:49:51Z","title":"Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T09:48:09.620197Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2510.13554"},"observation_digest":"sha256:f38e896f18dc95de04ccc17cc46c4e252d34d257a97c8ee1ea1a719f01145f20","observation_id":"f75f5912-6283-4211-b65b-87c1c27300ea","resolution":{"observed_at":"2026-08-04T09:48:09.620197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:0eafff804a57bb256b073661b48e899d7f17c77151f4b2fe4082d1202f80b47d","observation_id":"35632d2d-07c4-414f-ab1f-debbc018ba5b","resolution":{"observed_at":"2026-05-11T05:15:57.221330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T19:26:57.596581Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:82899a3aae57cde7ee61e180769e2661687361aee8da4571aa4ffecf9530de33","observation_id":"19f3b51f-5f6d-4cc8-9d2b-7ab238992ac9","resolution":{"observed_at":"2026-05-11T15:41:45.936142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:f9c4f30ce423cfa5351e2c4978a7e900ab7914dd601167da753c308574e0c864","observation_id":"502ff5c2-6737-426d-b756-4871a14cb9a7","resolution":{"observed_at":"2026-05-11T03:55:56.612400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.00425","last_updated":"2026-05-08T06:22:47Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:54:37Z","title":"AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:27.170349Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.00425"},"observation_digest":"sha256:6b3f33f0931286e8aefea02e30630b3b5bb19577c3a3da132df901bb7fb04e02","observation_id":"e34849f4-fe1f-4457-88a8-dfb5b5a9d82b","resolution":{"observed_at":"2026-05-11T15:26:17.685450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.00425","last_updated":"2026-05-08T06:22:47Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:54:37Z","title":"AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-11T00:58:25.685484Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.00425"},"observation_digest":"sha256:22c16fe124aeb61bdde5a75632a7e413ccdaf8e4a0f34501beafdae9f54be0e5","observation_id":"e91e85ca-8c04-49b9-83dc-32d945d0a665","resolution":{"observed_at":"2026-05-11T04:55:59.145694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.02178","last_updated":"2026-05-04T03:15:56Z","snapshot_observed_at":"2026-08-02T07:53:28.208356Z","submitted_at":"2026-05-04T03:15:56Z","title":"T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T19:36:00.359351Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.02178"},"observation_digest":"sha256:bb8a1e100b9a6c423d3e8207b2a3f9a40a3772cfaf932c7ba13ea705376d6c69","observation_id":"a537d1f3-4839-4130-a9e5-90f74f09a3fd","resolution":{"observed_at":"2026-05-09T05:45:22.203001Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:52.522238Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:cddea0caf977d2b232bfd12c0f0b69dc02ecafe787c5bcc102fba4ea2857f957","observation_id":"b267031b-ef27-4861-8b4f-2e522b92afc7","resolution":{"observed_at":"2026-05-11T20:06:08.516567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-11T02:00:00.663355Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:9bc2b503367d82f3030c965bbea5ca49e88f62e781e97d19e1d70218cb1995f4","observation_id":"88280954-5462-4afb-a651-9c0410b18b05","resolution":{"observed_at":"2026-05-11T04:00:56.957537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-13T07:17:13.708752Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:8ee982c2890f008fd56125aa388b5d3132e6a1f8587d371991eae78dbdbc9892","observation_id":"9645b42f-d3a0-415d-847f-ce765024c3cd","resolution":{"observed_at":"2026-05-13T07:17:28.392379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2606.25852","last_updated":"2026-06-24T14:02:13Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:02:13Z","title":"Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-25T20:16:39.347676Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2606.25852"},"observation_digest":"sha256:d2ede55ea042f6421a20b264dceac3a9a90b4bcdd36fcda2d046795583629f51","observation_id":"af7daae2-ef69-4176-a0e9-588baf808caa","resolution":{"observed_at":"2026-07-04T20:20:07.650170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-03T04:57:20.508738Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:13c179157e3caed4b27a85399afb358839e87e28f5ca6c804162521e99b389eb","observation_id":"1b4ac855-29fe-4c3f-bd0b-6a6e657fdfe0","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-08-02T03:56:27.159465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13753","last_updated":"2026-07-20T09:24:51Z","snapshot_observed_at":"2026-08-07T10:59:34.790525Z","submitted_at":"2026-07-15T12:12:37Z","title":"Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration","version":2},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-02T03:56:27.159465Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2607.13753"},"observation_digest":"sha256:cca1d7f6b2a1c0d89f18ca7114c927af8c415865c99d3db5d0ca3560dce41b2e","observation_id":"42bbac1a-559f-4d9c-b285-f70dfc65cc5b","resolution":{"observed_at":"2026-08-02T03:56:27.159465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-08-02T01:39:08.449103Z","title":"Harnessing uncertainty: Entropy-modulated policy gradients for long-horizon llm agents.arXiv preprint arXiv:2509.09265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14614","last_updated":"2026-07-16T06:25:19Z","snapshot_observed_at":"2026-08-07T00:14:51.071927Z","submitted_at":"2026-07-16T06:25:19Z","title":"Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:08.449103Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2607.14614"},"observation_digest":"sha256:4cc4fb4604efa2759127cc923cc20115c7a4ed7ab3fbe000e03b93b2b443c6d4","observation_id":"ff2c5ad0-5fd8-464e-8202-baa1d11ad2fd","resolution":{"observed_at":"2026-08-02T01:39:08.449103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09265/citation-record","integrity":"/paper/2509.09265/integrity","json":"/paper/2509.09265/citation-record.json","paper":"/paper/2509.09265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-04T19:28:56.091838Z","title":"The unreasonable effectiveness of entropy minimization in llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.091838Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:f4426e5e65aeea26959ad04eeb789feac2f7e2d3ecb744154dace69436733ba2","observation_id":"8aed9b11-2178-4d64-b947-6ad892f692a1","resolution":{"observed_at":"2026-08-04T19:28:56.091838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20201","last_updated":"2025-03-26T03:51:32Z","snapshot_observed_at":"2026-08-07T16:36:44.741741Z","submitted_at":"2025-03-26T03:51:32Z","title":"Open Deep Search: Democratizing Search with Open-source Reasoning Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20201","snapshot_observed_at":"2026-08-04T19:28:56.149783Z","title":"Open deep search: Democratizing search with open-source reasoning agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.149783Z"},"links":{"cited_paper":"/paper/2503.20201","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:74a28c03e61c795a6b53910f631b919da70ed2168086c0e43a0acc1d62ba50a1","observation_id":"e6144339-f32c-440d-a59d-ee4fd68eaee3","resolution":{"observed_at":"2026-08-04T19:28:56.149783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:56.219728Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.219728Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:5500f9ce3b94981379b5e647a6112b66f2da3a8963b7e9ece31f66ab4ed0e6d1","observation_id":"69199cbf-c8ef-4641-92ed-6d7e0819c1b2","resolution":{"observed_at":"2026-08-04T19:28:56.219728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-07T15:43:41.219115Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-04T19:28:56.258016Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.258016Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:3f89ca00bd9328e497e39f310d2d19357d2ed802759ed043715a515fe6fca7b9","observation_id":"2e325a43-c496-45a7-97ee-128721ef66f1","resolution":{"observed_at":"2026-08-04T19:28:56.258016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-04T19:28:56.355996Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.355996Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:85445a2d587ade9ce2f396d27113ed623a5c70336330f5ca5c88e37b6a85932d","observation_id":"a05d97b5-0110-4c94-ad1b-28ebe8aa8c2d","resolution":{"observed_at":"2026-08-04T19:28:56.355996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:56.497613Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.497613Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:c6e35c9ef58df1c1340d0e7af6af67e9a68aca039884acd38db2ba1a7c674b68","observation_id":"de68e66a-70e6-4029-bada-9fd30d5028ef","resolution":{"observed_at":"2026-08-04T19:28:56.497613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-07-06T19:46:06.343310Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-04T19:28:56.630716Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.630716Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:68ff9aaa73d5ea0d9d4290bc50b58165d48e6fdb01103b66e91dcc0091f46ba6","observation_id":"90f14950-d6d6-49b2-a74a-88977f7ab7ac","resolution":{"observed_at":"2026-08-04T19:28:56.630716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-04T19:28:56.713427Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.713427Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:a79790726f4ad7dfbe3469864bd617f2f1f4f2c08d8b3a8a7419af7d1d8d6628","observation_id":"df389e07-afe4-4d95-b7c9-51e573fb0dbc","resolution":{"observed_at":"2026-08-04T19:28:56.713427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-04T19:28:56.841114Z","title":"One-shot entropy minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.841114Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:1e66b717b39c81ec997b75e42db0e4309e99cb5cb202211c533d5a1aa6000262","observation_id":"596ef3ac-f757-494c-88ad-d727917f3bec","resolution":{"observed_at":"2026-08-04T19:28:56.841114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10120","last_updated":"2025-05-27T11:01:29Z","snapshot_observed_at":"2026-08-07T16:57:09.949824Z","submitted_at":"2025-01-17T11:12:28Z","title":"PaSa: An LLM Agent for Comprehensive Academic Paper Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10120","snapshot_observed_at":"2026-08-04T19:28:56.997117Z","title":"Pasa: An llm agent for comprehensive academic paper search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.997117Z"},"links":{"cited_paper":"/paper/2501.10120","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:2e1e6f6b8fd8165b2a18d1f97e97061df37ff34bb34d63fcb6f0a20f422e4fce","observation_id":"5c180ad2-db6c-4ea3-aa5a-3719bcc5a038","resolution":{"observed_at":"2026-08-04T19:28:56.997117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-04T19:28:57.112469Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.112469Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:46087d28d3439fa8d058385bb81e86099ad36f906a7edf09ffe65013d39441d6","observation_id":"8a1376b0-98e0-453f-9a7b-6f45d307f65a","resolution":{"observed_at":"2026-08-04T19:28:57.112469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-04T19:28:57.248343Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.248343Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:f1d7d065238780f2300fbc7b042f424b063183e3d6373128af44929f1607a0e1","observation_id":"a98c37c0-4a0b-49d9-aec4-9c9c63dc83ec","resolution":{"observed_at":"2026-08-04T19:28:57.248343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T19:28:57.347328Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.347328Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:6c64508c43fa277dfde4fe4e1045a45edb18cfe85f890fc8f58fbbadc2bc0e18","observation_id":"7a2f0c0c-7b53-403d-a0a3-9166689d0131","resolution":{"observed_at":"2026-08-04T19:28:57.347328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-04T19:28:57.447645Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.447645Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:1f8ed450617a20bf87d4e574558afb7ea0b8812f992752d093a3e035beb13549","observation_id":"38dc535f-1696-4f01-833e-38b59d342411","resolution":{"observed_at":"2026-08-04T19:28:57.447645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:57.566435Z","title":"Vineppo: Accurate credit assignment in rl for llm mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.566435Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:34e4712f647385fa554c9714afe5f089cd7b619844d44f2558f8e4b9473af4af","observation_id":"2fd13494-fcc6-4011-89cc-4a00c826e275","resolution":{"observed_at":"2026-08-04T19:28:57.566435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:57.653021Z","title":"Empowerment: A universal agent-centric measure of control","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.653021Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:2d10e3eb35d7b01421a42ef709d1c6414f5e216bbd41044cb01b7ed92603c7c0","observation_id":"30f6dae9-c4ec-4c99-b9ca-9a868bbf0e88","resolution":{"observed_at":"2026-08-04T19:28:57.653021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:57.767525Z","title":"Natural questions: a benchmark for question answering research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.767525Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:f85de81f5bf820471ac557d2df6e925e1787f9f7e93757356aaa39c7fcae8451","observation_id":"35a7abdd-7c0c-4d50-a6f7-1171953a310c","resolution":{"observed_at":"2026-08-04T19:28:57.767525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-04T19:28:57.876860Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.876860Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:4af5b6a679b84cc2b4115b449741f6b754aa9ab2661fb8bd731df3ee69b7aebb","observation_id":"f934fa58-2f68-4fe4-967a-97c41b32e0d2","resolution":{"observed_at":"2026-08-04T19:28:57.876860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12912","last_updated":"2025-06-15T17:02:39Z","snapshot_observed_at":"2026-08-07T00:34:50.634805Z","submitted_at":"2025-06-15T17:02:39Z","title":"Logit Dynamics in Softmax Policy Gradient Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12912","snapshot_observed_at":"2026-08-04T19:28:58.006560Z","title":"Logit dynamics in softmax policy gradient methods","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.006560Z"},"links":{"cited_paper":"/paper/2506.12912","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:126050e6256e9c0df9fc65ee2d4c9248b3e59ada6b6a2211e32f8a888932835c","observation_id":"1fb21e88-50dd-49a8-8d0b-b92dd067e492","resolution":{"observed_at":"2026-08-04T19:28:58.006560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:58.159200Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.159200Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:b9fadd6b856be9c97a866244167e8d80f4cda1e15fa483c3c63adf018e6e13b8","observation_id":"d76f24e3-2abd-46f0-a4c9-b1c56c5755a7","resolution":{"observed_at":"2026-08-04T19:28:58.159200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18279","last_updated":"2024-12-24T08:39:35Z","snapshot_observed_at":"2026-07-06T20:12:40.901520Z","submitted_at":"2024-12-24T08:39:35Z","title":"Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18279","snapshot_observed_at":"2026-08-04T19:28:58.286475Z","title":"Improving multi-step reasoning abilities of large language models with direct advantage policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.286475Z"},"links":{"cited_paper":"/paper/2412.18279","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:3627a2836b6903ca92f43f87e6234403aa7bfd208691be5d8273bc135d337729","observation_id":"13723c2e-df2d-4094-92f3-2598b454f8e0","resolution":{"observed_at":"2026-08-04T19:28:58.286475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:58.398421Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.398421Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:c29be835de1a4fafb2f5a19611d8e996412a7d9c64c1b347ddc63d2c314d64fe","observation_id":"9f632c4f-3d97-43b8-84de-1aa3165ac244","resolution":{"observed_at":"2026-08-04T19:28:58.398421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:58.536248Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.536248Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:451cffef946f70d5c9876cf46e4e3a84c9c104fa4c7bed3eb6d436b9042354a8","observation_id":"c6dc47bb-497e-43a0-a5c0-29aa152bc314","resolution":{"observed_at":"2026-08-04T19:28:58.536248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:58.698098Z","title":"On measures of entropy and information","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.698098Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:6c1cf4151d9e1fc1055d833101140aea3174c50b7d498be5187d100a77b6aa52","observation_id":"338e5196-915e-4c4f-a895-fdc764ad3033","resolution":{"observed_at":"2026-08-04T19:28:58.698098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T19:28:58.804689Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.804689Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:1385a5a73224471ccc16b1bc350ec7e36f276e5a9ee7f153a27af2ffe43f9a0f","observation_id":"496537d7-1db6-4c64-8b0d-8c1941c8e06e","resolution":{"observed_at":"2026-08-04T19:28:58.804689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:58.939607Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:58.939607Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:793e1267f788f51c352f6a88ad1aab67a51834e70ef74b5dd399f9a3fad3bc62","observation_id":"c13f59ad-c478-4952-8302-f56a62205fe9","resolution":{"observed_at":"2026-08-04T19:28:58.939607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T19:28:59.039537Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.039537Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:c5ef0af84b6289a7de2c948234ae5806715d2191501140c03cc3e2ecae643c14","observation_id":"578313fc-82c3-4f14-a902-e6c44baed511","resolution":{"observed_at":"2026-08-04T19:28:59.039537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T19:28:59.160640Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.160640Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:fc8b3f09938d1ab06f45a0133193dc5ee812a8e88ea6bd10b7d4a300a89ca5e9","observation_id":"4cbfc7c3-90c2-4ebe-9eac-f4d5ecd9477b","resolution":{"observed_at":"2026-08-04T19:28:59.160640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:59.252460Z","title":"Alfworld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.252460Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:7374e4a1ed6dbb9ca5b9ebfb7c68f27f0cac8200851106353b97fab4830e2cdd","observation_id":"e2dafed0-13fb-4382-8f5c-c771c102a2c6","resolution":{"observed_at":"2026-08-04T19:28:59.252460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22456","last_updated":"2025-03-31T10:13:48Z","snapshot_observed_at":"2026-08-07T16:30:11.848166Z","submitted_at":"2025-03-28T14:07:51Z","title":"Entropy-guided sequence weighting for efficient exploration in RL-based LLM fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22456","snapshot_observed_at":"2026-08-04T19:28:59.417616Z","title":"Entropy-guided sequence weighting for efficient exploration in rl-based llm fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.417616Z"},"links":{"cited_paper":"/paper/2503.22456","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:a2b804acf6739817021c6467bc7d30acac0b83dc1752ecd040aa5633065a242a","observation_id":"f6552af1-c61e-4232-b173-973651c25c94","resolution":{"observed_at":"2026-08-04T19:28:59.417616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-04T19:28:59.532301Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.532301Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:42781f72b7c71e46d98572560c477b267911bc68d96fb95f88fdab1744b53f3e","observation_id":"63c6d6a4-c0da-4806-bee3-5efbee141112","resolution":{"observed_at":"2026-08-04T19:28:59.532301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:59.677626Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.677626Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:5a1070153cb020db338bdb7feebded2b9967b549513785cb3dd524b83f63101f","observation_id":"6e5ac1ad-1a34-4f53-a377-5f6ec8f6946c","resolution":{"observed_at":"2026-08-04T19:28:59.677626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-04T19:28:59.797922Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.797922Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:476fd32a5c6ad77432c2be34d100a70f800977b14670d81f48c4a67553697a49","observation_id":"6515c5bd-58c0-4cf4-b7d8-601ecd8d0062","resolution":{"observed_at":"2026-08-04T19:28:59.797922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:28:59.907127Z","title":"Webagent-r1: Training web agents via end-to-end multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:59.907127Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:fa36cb60e36f81aeb59493a4dbf0844f77251b474715ff84a405a6ee9fbb48b5","observation_id":"c23d4d99-89c4-44d1-af99-5536df5706c6","resolution":{"observed_at":"2026-08-04T19:28:59.907127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07572","last_updated":"2025-08-10T05:59:20Z","snapshot_observed_at":"2026-08-04T14:46:05.418102Z","submitted_at":"2025-01-13T18:58:07Z","title":"WebWalker: Benchmarking LLMs in Web Traversal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07572","snapshot_observed_at":"2026-08-04T19:29:00.015869Z","title":"Webwalker: Benchmarking llms in web traversal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.015869Z"},"links":{"cited_paper":"/paper/2501.07572","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:80db941205281431f26ccef0f54e9abc57a4e1fb3f6237846c5543902e5fa276","observation_id":"9524d2bd-fded-4fd1-aa92-d028f2277706","resolution":{"observed_at":"2026-08-04T19:29:00.015869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07562","last_updated":"2023-11-13T18:53:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:53:37Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07562","snapshot_observed_at":"2026-08-04T19:29:00.066242Z","title":"Gpt-4v in wonderland: Large multimodal models for zero-shot smartphone gui navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.066242Z"},"links":{"cited_paper":"/paper/2311.07562","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:3878c1b70b176a039345455a502df4fdc30d18d6e04bd500da37c41cd24d5106","observation_id":"79d06aa4-e3b2-4652-8bf4-333ada1bd8ef","resolution":{"observed_at":"2026-08-04T19:29:00.066242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-04T19:29:00.156802Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.156802Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:11935f5540a1c4415e290df5a77f92f3f6d865e313cfea309d9b8c183714ace6","observation_id":"6100cb95-1387-4902-ae6c-048d1603b7c8","resolution":{"observed_at":"2026-08-04T19:29:00.156802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:00.216580Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.216580Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:5c2a688560435493df1cb9feed3b814cb4c06040a6983e5ee734881af0ec8d9d","observation_id":"7b0c2e6a-f183-4658-8568-718b3f7dc21e","resolution":{"observed_at":"2026-08-04T19:29:00.216580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:00.260395Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.260395Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:2e23c531c46d0a35bfe9dceee78595184298761bb69e3a262b92d251ecc11038","observation_id":"6f561e9c-1096-4605-be83-fe43692f07a8","resolution":{"observed_at":"2026-08-04T19:29:00.260395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T19:29:00.312931Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.312931Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:3eb31df303a3443acc5b71c400d838c514b5673208017cf2f9766e29a49b4790","observation_id":"b0a364ad-2e6c-41c5-acfa-bb7a56632527","resolution":{"observed_at":"2026-08-04T19:29:00.312931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07339","last_updated":"2024-08-09T06:16:55Z","snapshot_observed_at":"2026-07-06T17:15:22.551637Z","submitted_at":"2024-01-14T18:12:03Z","title":"CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07339","snapshot_observed_at":"2026-08-04T19:29:00.384563Z","title":"Codeagent: Enhancing code generation with tool-integrated agent systems for real-world repo-level coding challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.384563Z"},"links":{"cited_paper":"/paper/2401.07339","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:b0ba4fa2cd0f94e08e3ba8b195ada7b0c921fd4594182337d40e75c52a33c2ee","observation_id":"93c12cfa-257a-402a-8797-7fedceea0e0a","resolution":{"observed_at":"2026-08-04T19:29:00.384563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-08T00:32:04.126170Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-08-04T19:29:00.494940Z","title":"Consistent paths lead to truth: Self-rewarding reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.494940Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:41b82f81de461e52f79f7cefbd477f9855e24fdd98b0e7ef262abba882d40530","observation_id":"9cadc56b-68ff-4aa3-b874-4412ffc301f0","resolution":{"observed_at":"2026-08-04T19:29:00.494940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-07T16:07:37.899880Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-04T19:29:00.555925Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.555925Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:1ebd1293f94460c198e667c6c7009b45cee62b320dca5a51bab00291a55e7bd6","observation_id":"697a7a5f-2530-4662-8311-315ed08504e2","resolution":{"observed_at":"2026-08-04T19:29:00.555925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-08-04T19:29:00.634858Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.634858Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:b0a5331ef4ff03bf6865bd30d480809a49d9275a32a0bad61c65d88152149d6c","observation_id":"68eb5094-2f5b-4c44-a765-9f568ccab9f4","resolution":{"observed_at":"2026-08-04T19:29:00.634858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:00.713218Z","title":"Siren’s song in the ai ocean: A survey on hallucination in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.713218Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:eade4f4280484570c56c878bc22e1750cca74b04b182de220cdfa98b3009cc66","observation_id":"d1da1519-3ae0-4a72-9b73-a586bbd6349b","resolution":{"observed_at":"2026-08-04T19:29:00.713218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-04T19:29:00.812232Z","title":"Learning to reason without external rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.812232Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:5c3d3e1f3886b4c3de6c215f6d0804ccfb18085a191a63a015835fca1adc4393","observation_id":"3fcd945e-bbd1-4d25-9ba4-34ab0beecf44","resolution":{"observed_at":"2026-08-04T19:29:00.812232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-04T19:29:00.879986Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.879986Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:78bf5bb4b93e885e6c1c7ba9865321355075f4ea977fefc18663c5daece3b428","observation_id":"8f14c444-b12b-40e3-bcc2-a2bb4ad25b0e","resolution":{"observed_at":"2026-08-04T19:29:00.879986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:00.944566Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.944566Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:733e4014a267b8be85cb1cc5717617980dfb0ece86b78c0d63260b0f9689742e","observation_id":"b62c2e21-5fd7-44e5-b1da-582779056cf2","resolution":{"observed_at":"2026-08-04T19:29:00.944566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-04T19:29:01.018560Z","title":"T−1X t=0 (∇θ logπ θ(at|st))r int t (st+1;θ) # (20) =E τi∼πθ","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:01.018560Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:788ff6102d90417170f68ec8e6ddecbb6c9c7a357e35bbb26a7299461cee5351","observation_id":"499563ec-ca50-4acf-9bad-8a1cdb473d1c","resolution":{"observed_at":"2026-08-04T19:29:01.018560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:01.084911Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:01.084911Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:3c47b2971c0d33e9185c62c18ae99f8f19778901fd8af2c99fa9f1b60e536a45","observation_id":"a1e2fe69-8840-4377-82db-ba5776667af7","resolution":{"observed_at":"2026-08-04T19:29:01.084911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:01.211245Z","title":"stably all-correct","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:01.211245Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:ad27fcf804f68fec331e2df87969ccee3edb03cf3653f83c9bae130a0f459f6f","observation_id":"13689775-68ca-4d31-bf74-5c608d409620","resolution":{"observed_at":"2026-08-04T19:29:01.211245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:01.262634Z","title":"assistant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:01.262634Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:a47ce7d21d7b40c4fb2244d59d28bcdd031b1a0fc793709699e8f5baf793bb18","observation_id":"d4b72e7b-3861-44d5-96cd-595c8510e0f8","resolution":{"observed_at":"2026-08-04T19:29:01.262634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:01.353844Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:01.353844Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:2b24950043d34e5ff8834611be9b56b575b347ee5bea32dc7e17e747d4cdc1f0","observation_id":"544b829d-5b1a-42a3-99a3-714b0b53bbb8","resolution":{"observed_at":"2026-08-04T19:29:01.353844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:01.414578Z","title":"For each step, the advantage is scaled by g(Ht) and augmented by the future clarity bonus ζ·g ′(Ht+1), yielding the modulated advantageA mod as defined in our main formula (Eq","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:01.414578Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:d6f75a30696bbda97996b1e85391ab4b0453676d65a0e3310bd49343476564da","observation_id":"3a32333b-95bc-4e91-b1fd-9a0f0b8f2796","resolution":{"observed_at":"2026-08-04T19:29:01.414578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:29:01.480681Z","title":"assistant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:01.480681Z"},"links":{"citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:e04de8a067266a7a93754bf9dbe84ed4ffc314f655df1e2f1b83a1da714a5e6b","observation_id":"9322fcd5-3d85-4ad9-a19e-fc4273418d69","resolution":{"observed_at":"2026-08-04T19:29:01.480681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 14 inbound Pith citation observations for arXiv:2509.09265."}