{"as_of":"2026-08-10T03:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a233ae3e8956f65179424e5e53fc780a4b2069b0194951da77c17c60be8ac16a","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:49:37.950968Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08329/citation-record","integrity":"/paper/2509.08329/integrity","json":"/paper/2509.08329/citation-record.json","paper":"/paper/2509.08329"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:34.969319Z","title":"Leveraging more of biology in evolutionary reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:34.969319Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:568adf89de62b9f0ded30005cf6bfe571c1114a48963aca9df161157bafc1bcc","observation_id":"97998644-e4a1-4020-a550-a00f6d742ba2","resolution":{"observed_at":"2026-08-04T20:49:34.969319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.052254Z","title":"Reinforcement learning: A survey","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.052254Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:387efda9a49ede1260e5cc63141f6a72a85f4e70bb9fe712f1ce831514b5fedd","observation_id":"c79f6e3a-6f0c-4178-9e7f-8170e7c57446","resolution":{"observed_at":"2026-08-04T20:49:35.052254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.160418Z","title":"Model-based reinforcement learning: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.160418Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:0bc362824ba72822572a164a3d64d35da6722e23d4a8ae48f7fdf52e31ed15d7","observation_id":"34f310e9-2063-451b-a77b-437c94e076ab","resolution":{"observed_at":"2026-08-04T20:49:35.160418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.377055Z","title":"Implementation of Q-Learning algorithm for solving maze prob- lem","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.377055Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:732423d9395c6e9f1a4b70b4e74a80a69fdee5164112f2b62b772080d3c9095c","observation_id":"820a1662-99eb-4d92-b9ca-db254e92371f","resolution":{"observed_at":"2026-08-04T20:49:35.377055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.477722Z","title":"Sequence learning: From recognition and prediction to sequential decision making","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.477722Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b3d89176e7fc95fb9b7f700026906310f873132ea9742da405315f59bb1a85a2","observation_id":"b2731e05-0d63-49c3-ae8f-e6780a86f9fd","resolution":{"observed_at":"2026-08-04T20:49:35.477722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.587138Z","title":"Deep reinforcement learning for sequence-to-sequence models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.587138Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:aea00a9c917b0df2e42a41e45bf3bdc24241a6f30db1f764246c1101bb6d6101","observation_id":"bf08b2d6-0a04-4df6-abf1-3e1b1a14c4ec","resolution":{"observed_at":"2026-08-04T20:49:35.587138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.756581Z","title":"Adaptive look-ahead economic dispatch based on deep reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.756581Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:2aad1362c4cf639d5014ee138d4b756c78e580102db0694064aba7aa27bfc5f0","observation_id":"7e868f39-1469-4e0e-8d56-3512a90b8b41","resolution":{"observed_at":"2026-08-04T20:49:35.756581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.834370Z","title":"Recent developments of game theory and reinforce- ment learning approaches: A systematic review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.834370Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ba333fbd2448a024137efd314af9b89b71424cf9e2380ef272e6cf49ea8ebc6c","observation_id":"382bac6f-afd6-418c-8d7b-5b2176d1caf2","resolution":{"observed_at":"2026-08-04T20:49:35.834370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:35.919416Z","title":"Recent advances in reinforcement learning-based autonomous driving behavior planning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:35.919416Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b700381ee35b5db8f594c13c2407205e463d762944e3a0c07ebbb1db1e1f83f0","observation_id":"850b7ca9-92ae-44e6-80db-9f70a33b25a9","resolution":{"observed_at":"2026-08-04T20:49:35.919416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.018720Z","title":"Rein- forcement learning for autonomous process control in industry 4.0: Advantages and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.018720Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:6d7ad22f78866dd7a18913f8e6ea1dcc1431fb90ee05b48e420449608df86a8f","observation_id":"9efd5625-d009-4fa2-bf0f-8182676441b7","resolution":{"observed_at":"2026-08-04T20:49:36.018720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.122336Z","title":"A review of safe reinforcement learning: Methods, theories and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.122336Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:d784c3c2ff6713346bf7c466eb1fe71ff737bdbdfcbbc539c2a7978fde9b86f3","observation_id":"616f27f5-48e6-4a55-be90-9af4abd9da0e","resolution":{"observed_at":"2026-08-04T20:49:36.122336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.261063Z","title":"Distributed deep reinforcement learning based gradient quantization for federated learning enabled vehi- cle edge computing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.261063Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:eaecc241fefbe0324a7ef4ea31ec23dc058ac98a35cb032d6b9ace359682ca9f","observation_id":"56a2af26-ba0a-43bd-a36f-becdce148d43","resolution":{"observed_at":"2026-08-04T20:49:36.261063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.361800Z","title":"A review of research on reinforcement learning algorithms for multi-agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.361800Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c5439b151988f4788a2d22bcced68af0f1d3eda36e15440ad5305b673d58f7b4","observation_id":"5bde60e4-7b2c-4bbc-b1df-ad5dce53b398","resolution":{"observed_at":"2026-08-04T20:49:36.361800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.435227Z","title":"Toward enhanced reinforcement learning-based resource management via digital twin: Opportunities, applications, and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.435227Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:97876363c3c6b965a64ed6e26cd337965d6ebecbe0f51b64391494590909daf0","observation_id":"bb36baed-bee1-4509-9533-f174a228d9b0","resolution":{"observed_at":"2026-08-04T20:49:36.435227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.535488Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.535488Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:1a6d0fe57ae44529352980cd1f326c3f848ba03db17055c768707627754ce3de","observation_id":"4a718f5b-19d3-4b29-9a15-f13c145ebb75","resolution":{"observed_at":"2026-08-04T20:49:36.535488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.650605Z","title":"Evolu- tionary reinforcement learning: a systematic review and future directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.650605Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:4408a90e17a4196a7d8cfc6e0fd24caabc2584d8d034a7261807d2bd6b348fb0","observation_id":"c207e56b-9b43-485d-9dfc-fe9d160967de","resolution":{"observed_at":"2026-08-04T20:49:36.650605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06463","last_updated":"2024-11-10T13:35:10Z","snapshot_observed_at":"2026-07-06T19:48:05.525731Z","submitted_at":"2024-11-10T13:35:10Z","title":"RL-Pruner: Structured Pruning Using Reinforcement Learning for CNN Compression and Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06463","snapshot_observed_at":"2026-08-04T20:49:36.776845Z","title":"Rl-pruner: Structured pruning using reinforcement learning for cnn compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.776845Z"},"links":{"cited_paper":"/paper/2411.06463","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:e056c4be932ce741bc87f3dfc6de838fc816b0e15c5b9e6659b1dcc27800e933","observation_id":"6c017dfb-3f69-4f08-90ca-fae28ecfb380","resolution":{"observed_at":"2026-08-04T20:49:36.776845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.880267Z","title":"A Reinforcement Learning Training Acceleration Method Based on Knowledge Distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.880267Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:dab597478ea0fd8fcd305d068e58fcb914d345a43dbef710c633b1e506111485","observation_id":"37eb84f2-8d3a-4e10-afa7-b5768e6658d0","resolution":{"observed_at":"2026-08-04T20:49:36.880267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:36.993310Z","title":"Plan-based reward shaping for reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:36.993310Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:47975a5aab58df00e0bf215b2ec8801b5615dcb034cafe490ac6f28d5d1b8991","observation_id":"ef49b158-ab05-4ac1-bbbf-565c6e550954","resolution":{"observed_at":"2026-08-04T20:49:36.993310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.095843Z","title":"Cur- riculum learning for reinforcement learning domains: A framework and survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.095843Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:749a08a84fbdc5dd34d071e58901a6e37baa5e9970b6efae238da3e45ee5ea09","observation_id":"6279c055-d5d8-495c-907a-9d83eb08c3c8","resolution":{"observed_at":"2026-08-04T20:49:37.095843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.202554Z","title":"Learning for a robot: Deep reinforcement learning, imitation learning, transfer learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.202554Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:1525e27b5275a0a2946a5bb3d8992f551c92e001e87ce6a75725a8b3a41b7e8c","observation_id":"bda7df39-dbd7-42f9-92e9-eb3f2758db26","resolution":{"observed_at":"2026-08-04T20:49:37.202554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.320789Z","title":"Meta-learning in reinforcement learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.320789Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a12eebd9687a5f6a3b7b702fe16bb66043a1db4cda26d0a3fcaa9f7966bf11e8","observation_id":"8e3be7d4-cfe9-4dca-9b49-c9c20463f502","resolution":{"observed_at":"2026-08-04T20:49:37.320789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16181","last_updated":"2024-02-25T20:07:13Z","snapshot_observed_at":"2026-08-04T14:27:16.874742Z","submitted_at":"2024-02-25T20:07:13Z","title":"How Can LLM Guide RL? A Value-Based Approach","version":1},"cited_work":{"arxiv_id":"2402.16181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16181","snapshot_observed_at":"2026-08-04T20:49:38.670045Z","title":"How Can LLM Guide RL? A Value-Based Approach","venue":"cs.LG","work_id":"9ccf02cd-8c73-414c-83e2-7cb3061938c6","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.369250Z"},"links":{"cited_paper":"/paper/2402.16181","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:484e94240cb0855da292ea66b959dd7af34e36730bd67eea931aa06a1ccd83cc","observation_id":"a83b7b2c-630d-41c5-8d9e-db6c08b215e3","resolution":{"observed_at":"2026-08-04T20:49:38.673521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:49:37.442918Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.442918Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:8502c5cc02c106f41880139b71b1216804c26cee7d4dee638bb93dedbf69f624","observation_id":"cf13cf78-cf9a-4331-8e3c-a3fba642522a","resolution":{"observed_at":"2026-08-04T20:49:37.442918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T20:49:37.562259Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.562259Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:cf94e50aa313ef330ea0e5e4eac96d88143fba9e83b60148cfd05b2f478d0898","observation_id":"e52e8950-48be-4834-b1c4-cc78dd31c809","resolution":{"observed_at":"2026-08-04T20:49:37.562259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-04T20:49:37.666569Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.666569Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:1f3560e5b454ec98e452eb2379ec1fee198216f0145e9ac73af655c31bc3e1bb","observation_id":"a0f7a012-0b4a-4f90-b47f-fbaa755b948e","resolution":{"observed_at":"2026-08-04T20:49:37.666569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04268","last_updated":"2023-08-08T14:09:33Z","snapshot_observed_at":"2026-07-06T16:03:54.971351Z","submitted_at":"2023-08-08T14:09:33Z","title":"Teacher-Student Architecture for Knowledge Distillation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04268","snapshot_observed_at":"2026-08-04T20:49:37.679757Z","title":"Teacher-student archi- tecture for knowledge distillation: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.679757Z"},"links":{"cited_paper":"/paper/2308.04268","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:8c0481425076c19af8ee1d61d4f60767cd9c3e4fd516f530bff6c74ab102c86c","observation_id":"913436a7-c629-4377-b252-e8cf67bbe361","resolution":{"observed_at":"2026-08-04T20:49:37.679757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18978","last_updated":"2024-04-29T14:53:48Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-29T14:53:48Z","title":"Towards Generalizable Agents in Text-Based Educational Environments: A Study of Integrating RL with LLMs","version":1},"cited_work":{"arxiv_id":"2404.18978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.18978","snapshot_observed_at":"2026-08-04T20:49:38.619462Z","title":"Towards Generalizable Agents in Text-Based Educational Environments: A Study of Integrating RL with LLMs","venue":"cs.LG","work_id":"e46f51a4-0553-4f20-bc62-9bec4db16005","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.683840Z"},"links":{"cited_paper":"/paper/2404.18978","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a860e6e60769e9cdd3a71292a1ef481cc2d3915bb844cb684e480521ff48ee0e","observation_id":"e04ffcf8-cdfd-4dbd-884c-1b5eaac566bd","resolution":{"observed_at":"2026-08-04T20:49:38.622706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.698214Z","title":"Intelligent Control of Closed-Loop Sedation in Simulated ICU Patients","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.698214Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c31670d69e56f808030875fd802e75bf1e7c9c125260f1cd23ae1fb3b830046c","observation_id":"b0066dd9-a966-4ce1-ab4f-09c8b0de1e33","resolution":{"observed_at":"2026-08-04T20:49:37.698214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.702112Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.702112Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:4541167420412aebaacf2a6b23771d5a2c63b146a0c66b1e2d50eb607ad61514","observation_id":"1597274e-961e-4ec4-944f-f03f2bc0ae98","resolution":{"observed_at":"2026-08-04T20:49:37.702112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.705793Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.705793Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f9b574291c3dc71c768d52544147cd75b4584101fc7ecec251ce6a86388a324a","observation_id":"acd467bf-ea7c-4160-a5b2-b9d962c60299","resolution":{"observed_at":"2026-08-04T20:49:37.705793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.709322Z","title":"A reinforcement learning approach to obtain treatment strategies in sequential medi- cal decision problems","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.709322Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f8f32c10644966e48c8584cc6a11195cb745d39fb47978e9c25d6e45d6cbd9a2","observation_id":"34523da3-6534-4058-b5aa-cc1ead0ac15a","resolution":{"observed_at":"2026-08-04T20:49:37.709322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.712892Z","title":"Rein- forcement Learning for Closed-Loop Propofol Anesthesia: A Study in Human V olunteers","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.712892Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:2e3e93a8a23eba4456b1cf9dfbb233ad1ccc9d8631074eda4577049eeb28f6fb","observation_id":"53a8f259-8ef5-400f-a719-c7ccf1e195ef","resolution":{"observed_at":"2026-08-04T20:49:37.712892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1134/s1064226919120131","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"7. Using Reinforcement Learning in the Algorithmic Trading Problem","venue":"Journal of Communications Technology and Electronics","work_id":"3296875a-0c09-4a68-af35-63cb95fb992e","year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.716869Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a903653cecef1ec45bfe1a562bed6e21ff63975c428822d13670f734421d3e0f","observation_id":"347e3caa-c511-46cc-b297-818ee7f161cb","resolution":{"observed_at":"2026-08-04T20:49:38.108475Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.87013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.604500Z","title":"Deep Reinforcement Learning for Optimizing Finance Portfolio Man- agement","venue":null,"work_id":"50a2008f-3613-4cd8-ab11-4bef6ada4c7d","year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.720364Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:4c7f4ceaafff0c3e3b429680371330c0a131213f07ad7b88f8edb37dad27b735","observation_id":"a3256e0d-893c-444e-9021-ae12db819375","resolution":{"observed_at":"2026-08-04T20:49:38.609023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04240","last_updated":"2018-05-21T18:25:38Z","snapshot_observed_at":"2026-07-06T06:22:59.316032Z","submitted_at":"2018-02-12T18:41:57Z","title":"Reinforcement Learning for Solving the Vehicle Routing Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04240","snapshot_observed_at":"2026-08-04T20:49:37.723759Z","title":"Deep Reinforcement Learning for Solving the Vehicle Routing Problem","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.723759Z"},"links":{"cited_paper":"/paper/1802.04240","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f061256208c7ef921773477a664778398f482a9c8b16aa3022695158d425f13f","observation_id":"c53ff995-c701-4e02-8882-a2275dbdb1ab","resolution":{"observed_at":"2026-08-04T20:49:37.723759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.89676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.579439Z","title":"Reinforcement Learning Boat Autopilot: A Sample-efficient and Model Predictive Control based Approach","venue":null,"work_id":"3dd3f914-c615-4a9e-bebf-1f76cffe184c","year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.727569Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:9a82cc6962effd7a55dda388d11b8520f355570dab88f96909b3d7fba90903e7","observation_id":"2c21783d-75c7-4b29-975f-3a8c51007b14","resolution":{"observed_at":"2026-08-04T20:49:38.584549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.730776Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.730776Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:d1a4360b449d0d5ed217acbbca82a2f39a819e6f7fbfb999c9c4c36d11b9a4d1","observation_id":"54991b6d-13a6-4817-a373-dd84d3210b0b","resolution":{"observed_at":"2026-08-04T20:49:37.730776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.733754Z","title":"Reinforcement learning in artificial and biological systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.733754Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a21904242d4e36e0dff0696c9a17fc16648146fb2b2f749e94bd813517a57d57","observation_id":"e0e642b9-ee61-4a04-996d-35055efbedef","resolution":{"observed_at":"2026-08-04T20:49:37.733754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.737230Z","title":"Introduction to reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.737230Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:bc58d7fdea6a5e5fd87ff372137e318342a380f28ceb8eb339de7eece5dd82d4","observation_id":"0668dfd1-9c6f-4d29-a824-321a3255a638","resolution":{"observed_at":"2026-08-04T20:49:37.737230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.740802Z","title":"A generalized reinforcement-learning model: Convergence and appli- cations","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.740802Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b39b556dedf6c3b8a73772b4c35687a20ea2243cb5c843ec4e0f57a25bdeac2e","observation_id":"4b58e068-7a7c-4c2f-8d16-18e029473e81","resolution":{"observed_at":"2026-08-04T20:49:37.740802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.743964Z","title":"Q-learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.743964Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f017d40637305f8220320de33c72211f020fb32ceb0e5473c42d91a9ef70ba3b","observation_id":"ccf8d915-cb40-4d7d-98b0-323acc5edf54","resolution":{"observed_at":"2026-08-04T20:49:37.743964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.747016Z","title":"Value-free reinforcement learning: policy optimization as a minimal model of operant behavior","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.747016Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f4b30c282b4a883cbc2df62cbe5d6752bcc2ed94e900dc6e07ca196560566fdd","observation_id":"8b5c1543-1014-43c2-97c2-b3a5d7bdbaba","resolution":{"observed_at":"2026-08-04T20:49:37.747016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.859373Z","title":"Actor-Critic Reinforcement Learning and Ap- plication in Developing Computer-Vision-Based Interface Tracking","venue":null,"work_id":"f00c3990-2312-4c0d-a396-52caaae10839","year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.750197Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:30c6eb3023b2232dba3abd1b67a7f598a1aa23fbf9c1bc89fa68060ba4bbc995","observation_id":"2b0fb647-960b-40ae-96f3-0d4afa374a99","resolution":{"observed_at":"2026-08-04T20:49:38.862730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.849070Z","title":null,"venue":null,"work_id":"8bf05cc4-bea5-4587-ae7e-fd04a3c16ffa","year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.753240Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:81bed3da0019d71710df9e946801396223d5bcd083accb5976767a504df02478","observation_id":"839563fb-30a3-40a9-879d-a59e2a374504","resolution":{"observed_at":"2026-08-04T20:49:38.852218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-04T20:49:37.756531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.756531Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ae8a7aa8a9a02b271d7b3649b4d1cc7aca27ceb80f71485ed92f37e84fd05b7a","observation_id":"7a4a842e-b2c9-4199-a853-d628c09366ae","resolution":{"observed_at":"2026-08-04T20:49:37.756531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-04T20:49:37.759899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.759899Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c43085416f1da8515c45e5110bc8859e9895c424e287f3a955027d12085a3dea","observation_id":"d7f5c7ec-2cb9-4311-a3c5-9a50cccdc799","resolution":{"observed_at":"2026-08-04T20:49:37.759899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-04T20:49:37.763648Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.763648Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:17e1c185afcd89f52890bd81335b00cb8e3bdf54d8d42c280b394b07377b1f4a","observation_id":"c73edb9b-9207-47b4-a80d-777ac9b2c41d","resolution":{"observed_at":"2026-08-04T20:49:37.763648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.766956Z","title":"Large language models surpass human experts in predicting neuroscience results","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.766956Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:eecc1ad0bd7000bec346213a094089111a85a01163d8ca46bd8e7aaa0fb759df","observation_id":"169ab558-0904-4eea-bb73-fc619308b5ed","resolution":{"observed_at":"2026-08-04T20:49:37.766956Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08910","last_updated":"2020-10-05T21:26:45Z","snapshot_observed_at":"2026-08-03T03:30:56.636820Z","submitted_at":"2020-02-10T18:55:58Z","title":"How Much Knowledge Can You Pack Into the Parameters of a Language Model?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08910","snapshot_observed_at":"2026-08-04T20:49:37.770353Z","title":"arXiv:2002.08910 [cs.CL].URL:https://arxiv.org/abs/ 2002.08910","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.770353Z"},"links":{"cited_paper":"/paper/2002.08910","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f7f95ecb737a407ce2a7c6bdac476384848ba5d15813e50f3e12fc99b06d3c47","observation_id":"485da6c9-08c4-4a10-8cbf-b76a49004695","resolution":{"observed_at":"2026-08-04T20:49:37.770353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00297","last_updated":"2021-09-10T00:54:47Z","snapshot_observed_at":"2026-08-09T12:58:55.895284Z","submitted_at":"2021-01-01T19:01:09Z","title":"Analyzing Commonsense Emergence in Few-shot Knowledge Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00297","snapshot_observed_at":"2026-08-04T20:49:37.773737Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.773737Z"},"links":{"cited_paper":"/paper/2101.00297","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:4b345d691804c646178d3d0468df2eb478df58c2a78857533d5424078e9c7a9c","observation_id":"9c18f6c0-8fca-4bcd-ae23-f34ed48ba83b","resolution":{"observed_at":"2026-08-04T20:49:37.773737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06474","last_updated":"2023-05-10T21:43:42Z","snapshot_observed_at":"2026-07-06T15:25:47.518595Z","submitted_at":"2023-05-10T21:43:42Z","title":"Do LLMs Understand User Preferences? Evaluating LLMs On User Rating Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06474","snapshot_observed_at":"2026-08-04T20:49:37.776970Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.776970Z"},"links":{"cited_paper":"/paper/2305.06474","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:b5716f0951c108b4d070a688427f3490284f019db0c885b430c77f5523137f59","observation_id":"0b5c305f-85f3-488f-adda-02849442b081","resolution":{"observed_at":"2026-08-04T20:49:37.776970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.780199Z","title":"TALLRec: An Effec- tive and Efficient Tuning Framework to Align Large Language Model with Recommendation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.780199Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:c9fbdfd3ea701812b27f0f20019bd13b074feb97ad70c5afdef806aea339411f","observation_id":"9f8804ac-45b9-4662-98e4-939c42c56458","resolution":{"observed_at":"2026-08-04T20:49:37.780199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.838310Z","title":"LLM-Rec: Personalized Recommendation via Prompting Large Language Models","venue":null,"work_id":"e617de42-b1ee-4e1a-8774-a232a22bb917","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.783309Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:191e7ee28d98a7b29d40612e7c7ef95c342149e4c568355e9f16166763290c26","observation_id":"8eea794a-f34f-4b0f-871a-1ac091ca6bd7","resolution":{"observed_at":"2026-08-04T20:49:38.841829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.827666Z","title":"Review-driven Personalized Preference Reasoning with Large Language Models for Recommendation","venue":null,"work_id":"8aeed9ad-0281-416d-b9ad-fe1af0bf7178","year":null},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.786263Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:cbb10296d65642fad2fb1a23c6a5e1728155206e9aa260f01f220959e1be63b4","observation_id":"71897617-f03c-4e26-b5b0-151f869fecf6","resolution":{"observed_at":"2026-08-04T20:49:38.831431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.794271Z","title":"Wordcraft: Story Writing With Large Lan- guage Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.794271Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:007be0e8f642a180f34587c231735bec94a58e9b829327e8feca0a82d3bcb669","observation_id":"c677e816-9da8-457b-8bb7-e528754de729","resolution":{"observed_at":"2026-08-04T20:49:37.794271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.11350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.477508Z","title":"A comprehensive survey on integrating large language models with knowledge-based methods","venue":null,"work_id":"42e3c109-48ae-455b-a601-ae767be5ba86","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.797358Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a999669547947b5e0f898c952976cdc4445e527da2edc5ce86a75131b8682d1c","observation_id":"e341a6e8-33f9-4a6f-a4c2-604358fccd77","resolution":{"observed_at":"2026-08-04T20:49:38.482722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07984","last_updated":"2023-10-12T02:17:59Z","snapshot_observed_at":"2026-07-06T16:31:37.625496Z","submitted_at":"2023-10-12T02:17:59Z","title":"Large Language Models for Scientific Synthesis, Inference and Explanation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07984","snapshot_observed_at":"2026-08-04T20:49:37.800923Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.800923Z"},"links":{"cited_paper":"/paper/2310.07984","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:77aff793034f36e17f8f6e594bfa67cf66d86065552cd3230f8150bd8078c9f9","observation_id":"320b0594-c9cb-4101-9eb6-3d784beb10ea","resolution":{"observed_at":"2026-08-04T20:49:37.800923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01063","last_updated":"2025-02-05T14:42:36Z","snapshot_observed_at":"2026-07-06T18:55:57.425474Z","submitted_at":"2024-08-02T07:31:57Z","title":"Leveraging Encoder-only Large Language Models for Mobile App Review Feature Extraction","version":2},"cited_work":{"arxiv_id":"2408.01063","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01063","snapshot_observed_at":"2026-08-04T20:49:38.454667Z","title":"Leveraging Encoder-only Large Language Models for Mobile App Review Feature Extraction","venue":"cs.CL","work_id":"82e372b4-6d92-4245-981a-be9d48f1288d","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.804114Z"},"links":{"cited_paper":"/paper/2408.01063","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:e1f37390fd8dd4d9202fd570b31ec37a44eccbdd1602ae6d95037b12da8b1def","observation_id":"f258a823-2377-476b-86e8-218e3598e0d6","resolution":{"observed_at":"2026-08-04T20:49:38.458130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02990","last_updated":"2024-07-02T07:59:40Z","snapshot_observed_at":"2026-08-09T02:48:35.024169Z","submitted_at":"2024-03-05T14:11:54Z","title":"Data Augmentation using Large Language Models: Data Perspectives, Learning Paradigms and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02990","snapshot_observed_at":"2026-08-04T20:49:37.807472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.807472Z"},"links":{"cited_paper":"/paper/2403.02990","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:e643191b11284d701d88eb90084ba4cc0cd31d5dffb5eb59c3051025c8bd110b","observation_id":"d52c73ad-74e1-4e7d-bcd0-a80835ca7701","resolution":{"observed_at":"2026-08-04T20:49:37.807472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16361","last_updated":"2024-10-27T19:35:47Z","snapshot_observed_at":"2026-08-09T15:03:46.117062Z","submitted_at":"2023-08-30T23:28:43Z","title":"Large Language Models as Data Preprocessors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16361","snapshot_observed_at":"2026-08-04T20:49:37.811300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.811300Z"},"links":{"cited_paper":"/paper/2308.16361","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:51821a9a84744d9a94ac163976b1a3a4d35221d03a578b6bb63c5a3273679c19","observation_id":"167ab8dd-bad4-450b-9ae0-7a8b773e333e","resolution":{"observed_at":"2026-08-04T20:49:37.811300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.817535Z","title":"DiarizationLM: Speaker Diarization Post-Processing with Large Language Models","venue":null,"work_id":"af68b5aa-fa13-4722-b737-40650740211f","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.815064Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a539dee2181a4fcdcf11a4db8e515598c3f85182243d4f47ab883da9135df64d","observation_id":"c25e1175-70f2-4f7b-994b-d805a28f3250","resolution":{"observed_at":"2026-08-04T20:49:38.820945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.818378Z","title":"Data Augmentation for Intent Classification with Off-the-shelf Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.818378Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ae80f94cf3ec75d18307fb32970c16d91e88241e92267311cc9a7f105c59135a","observation_id":"52f1937a-41ac-4b9b-8cb2-d023b6eb67c9","resolution":{"observed_at":"2026-08-04T20:49:37.818378Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.821853Z","title":"When and how to paraphrase for named entity recognition?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.821853Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:190fc8aeaf2d8aa0c1fd87c36e736ded6e8e3c99e864dda75d4411f146066dd9","observation_id":"7b17a9e9-a00a-4fb3-b3f6-3743389564d0","resolution":{"observed_at":"2026-08-04T20:49:37.821853Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07047","last_updated":"2024-02-20T06:12:39Z","snapshot_observed_at":"2026-08-06T03:51:45.774784Z","submitted_at":"2023-07-13T20:02:50Z","title":"Does Collaborative Human-LM Dialogue Generation Help Information Extraction from Human Dialogues?","version":2},"cited_work":{"arxiv_id":"2307.07047","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.07047","snapshot_observed_at":"2026-08-04T20:49:38.421116Z","title":"Does Collaborative Human-LM Dialogue Generation Help Information Extraction from Human Dialogues?","venue":"cs.CL","work_id":"5fd232cb-f743-4152-bee4-3b5d368e8139","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.825035Z"},"links":{"cited_paper":"/paper/2307.07047","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:5cd468b9a6e227ccd8894acc866699d3ad35d0630204e4a939b702997606be77","observation_id":"2d5c61ac-b1b9-4897-b28f-e07023de6692","resolution":{"observed_at":"2026-08-04T20:49:38.424776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T20:49:37.828512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.828512Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:3534571e1d822119762453266d73eaea0a4a551ab999eb8b0dfc0b0778b80009","observation_id":"471b3a71-5314-4d8c-92b9-b09b593b1b8c","resolution":{"observed_at":"2026-08-04T20:49:37.828512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.807253Z","title":null,"venue":null,"work_id":"6044c4cb-24a1-4a86-b7a4-d7af3f15ee40","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.831676Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:027967bbc462fb0a57ce655866c22b5e11179f1e27a67a85f084aedaa3b83745","observation_id":"49b0f118-b64e-4178-9d88-ddb33e141722","resolution":{"observed_at":"2026-08-04T20:49:38.810473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.608.url:http:","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.071722Z","title":"Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models","venue":null,"work_id":"82442691-e7fb-4771-ab26-df2db4acbceb","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.834886Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:d4d8ba2b111dda1ed406a0b69af36e2aaa114a5f4eb97b5dd4f021636570aa81","observation_id":"19340d35-d8dc-492b-a01e-da2c002f59f8","resolution":{"observed_at":"2026-08-04T20:49:38.075453Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10299","last_updated":"2025-02-14T17:01:06Z","snapshot_observed_at":"2026-08-07T18:34:41.300227Z","submitted_at":"2025-02-14T17:01:06Z","title":"Open-Source AI-Powered Optimization in Scalene: Advancing Python Performance Profiling with DeepSeek-R1 and LLaMA 3.2","version":1},"cited_work":{"arxiv_id":"2502.10299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10299","snapshot_observed_at":"2026-08-04T20:49:38.396785Z","title":"Open-Source AI-Powered Optimization in Scalene: Advancing Python Performance Profiling with DeepSeek-R1 and LLaMA 3.2","venue":"cs.PL","work_id":"96dbd6a1-1427-4707-b68a-e652a7f5b106","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.838235Z"},"links":{"cited_paper":"/paper/2502.10299","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:78b2b7463ce39cafb2b0d49cee8ba4a5e45e164aaccb209347cb6abc68a2e191","observation_id":"e0747679-0ef8-45fc-8748-90c167363d09","resolution":{"observed_at":"2026-08-04T20:49:38.400364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-04T20:49:37.841831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.841831Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:68c4514f94692782f4f387469a762d4c8f2dc8a986c3a0cb16b2acc5fda5edbb","observation_id":"962487d1-4a09-403b-9316-9085a2f737fb","resolution":{"observed_at":"2026-08-04T20:49:37.841831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.845804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.845804Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:75ededfa22d81d4b8284e882182a6bcebe981739badec492dcd96f7b4abc2ba8","observation_id":"686ddd5b-ecaa-4113-8836-f4563aff8576","resolution":{"observed_at":"2026-08-04T20:49:37.845804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10938","last_updated":"2022-12-21T11:25:41Z","snapshot_observed_at":"2026-08-02T19:28:50.549225Z","submitted_at":"2022-12-21T11:25:41Z","title":"Critic-Guided Decoding for Controlled Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10938","snapshot_observed_at":"2026-08-04T20:49:37.849055Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.849055Z"},"links":{"cited_paper":"/paper/2212.10938","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:0f0de7522b1151cf9df6bbba8bfc5e07f1e5e644192a79dbc5c615d9118670d5","observation_id":"3949d292-4765-4560-832c-495e536ca763","resolution":{"observed_at":"2026-08-04T20:49:37.849055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:37.852560Z","title":"Reward modeling for mitigating toxicity in transformer- based language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.852560Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:eea84d9797cb7c7fa3265d2e67b223e80f74c68becfb6be2d63e5c3e2cfba523","observation_id":"a8ea7f94-81e9-4deb-96e4-6287b9e6be76","resolution":{"observed_at":"2026-08-04T20:49:37.852560Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-04T20:49:37.856497Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.856497Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:75a4c38a81aa6ad0dc10b777993b7958f35e7fd2805e3a704ea24efbe6b04e72","observation_id":"8b673578-115d-4b94-a7b6-5a32df5b2d83","resolution":{"observed_at":"2026-08-04T20:49:37.856497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-04T20:49:37.860236Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.860236Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:5af4628bcc5ee35c3b34d37dad36d13de6b2ecff79caa5e55e40f53d5eb53bc1","observation_id":"5c83c194-5500-4e25-8fcd-2a01803b5c5d","resolution":{"observed_at":"2026-08-04T20:49:37.860236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-08T07:32:45.881885Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-04T20:49:37.863607Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.863607Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ebf8342b80ff869ee4d3c9008fa92d34c0b41713d9ff1e165a1eeeabc472a849","observation_id":"c03c4cad-38a5-4fd7-b10b-54ea38f68ead","resolution":{"observed_at":"2026-08-04T20:49:37.863607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T20:49:37.867399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.867399Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:146d36397a9370d6ff697411a5d2c8a4311999f3955e2481916b5231cab4aebf","observation_id":"390243b3-4aaf-49c1-a16e-221c9a50427c","resolution":{"observed_at":"2026-08-04T20:49:37.867399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-04T20:49:37.871050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.871050Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:2326c9df4abcaafbdfa43042ccdf1a7bc0ff951168ef5f5f207cbc03f6bae357","observation_id":"328e2211-4bb1-46a9-81e1-360362a1d399","resolution":{"observed_at":"2026-08-04T20:49:37.871050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.796584Z","title":"2025.URL:https://openreview.net/forum? id=6y00rooi7i","venue":null,"work_id":"8f579925-0eb3-4935-98ce-f1101f451f1c","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.874812Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:f16d14bb4d2280261389bb9249851ec2d3d47f02c3936984cc5d1528e93fb572","observation_id":"a0f5f510-9372-4477-8cdc-0e2fba197146","resolution":{"observed_at":"2026-08-04T20:49:38.799899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06025","last_updated":"2024-07-08T15:22:49Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T15:22:49Z","title":"iLLM-TSC: Integration reinforcement learning and large language model for traffic signal control policy improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06025","snapshot_observed_at":"2026-08-04T20:49:37.878308Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.878308Z"},"links":{"cited_paper":"/paper/2407.06025","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:fa9917fef4ab2039d63bb22d23a9cea9caf27115b153ca26025a4544e948e6fc","observation_id":"7c42d6f5-becd-4159-bdfc-9ca99d52ee0a","resolution":{"observed_at":"2026-08-04T20:49:37.878308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.294067Z","title":"Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxon- omy, and Methods","venue":null,"work_id":"b06c56f5-2d5b-41ca-9e29-c861e58fd156","year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.882153Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:aad17d75346378252bd6d2e63c39b01bbebd5c2c67922455444012ae8e1c7cdd","observation_id":"7cf13e67-2e61-4feb-8c4c-2dafb40dba46","resolution":{"observed_at":"2026-08-04T20:49:38.299793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.785795Z","title":"Learning by Reusing Previous Advice in Teacher- Student Paradigm","venue":null,"work_id":"7cff0191-eb15-4201-9bb2-1209c55ff8a2","year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.885288Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:9809229cf7be48a3e251572c54aa54e3eeb093557cb7eafcf58280d48c90d4e1","observation_id":"36150866-9739-4fc0-89e7-099a1d5f47f7","resolution":{"observed_at":"2026-08-04T20:49:38.789371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.774822Z","title":"Minigrid & miniworld: modular & customizable reinforcement learning environments for goal-oriented tasks","venue":null,"work_id":"1ef2d3ef-cd36-4126-991f-9cc7004dd670","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.888834Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:288024ce0a3a87f613d60d93d87ba1a8d23538a0543182229eb4d2815bf1f00e","observation_id":"04655b6d-2442-46b1-a37f-8cb5c2c79635","resolution":{"observed_at":"2026-08-04T20:49:38.778651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13202","last_updated":"2021-11-16T21:17:20Z","snapshot_observed_at":"2026-08-08T14:42:59.429857Z","submitted_at":"2021-09-27T17:22:42Z","title":"MiniHack the Planet: A Sandbox for Open-Ended Reinforcement Learning Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13202","snapshot_observed_at":"2026-08-04T20:49:37.891940Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.891940Z"},"links":{"cited_paper":"/paper/2109.13202","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:a9fafc943cc2c934a09b14fef26fdbe42f8bcef293977d930ecf35e4613b1d8f","observation_id":"21d1212b-e624-4f07-9804-cbf5cdfcecbe","resolution":{"observed_at":"2026-08-04T20:49:37.891940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06780","last_updated":"2022-02-12T20:02:13Z","snapshot_observed_at":"2026-08-08T06:33:33.529614Z","submitted_at":"2021-09-14T15:49:31Z","title":"Benchmarking the Spectrum of Agent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06780","snapshot_observed_at":"2026-08-04T20:49:37.895334Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.895334Z"},"links":{"cited_paper":"/paper/2109.06780","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:7c3a3a8982770fc663b913f1d9ba78e7efcce4d2c99052ba8450035486276a4e","observation_id":"afd4d3b6-33c3-4d96-8c29-c5fe411cd001","resolution":{"observed_at":"2026-08-04T20:49:37.895334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05596","last_updated":"2023-11-09T18:54:28Z","snapshot_observed_at":"2026-08-09T15:29:42.575565Z","submitted_at":"2023-11-09T18:54:28Z","title":"LLM Augmented Hierarchical Agents","version":1},"cited_work":{"arxiv_id":"2311.05596","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05596","snapshot_observed_at":"2026-08-04T20:49:38.259372Z","title":"LLM Augmented Hierarchical Agents","venue":"cs.LG","work_id":"49831c8a-1c8a-48b5-9185-81363cb3f786","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.898683Z"},"links":{"cited_paper":"/paper/2311.05596","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:25fdfadfda4e081ec585ea6bb284f01a3baf6c12c53691f73bb11ec530fe6cdd","observation_id":"251ee647-48b4-4447-bdd0-a77c3aaaf30a","resolution":{"observed_at":"2026-08-04T20:49:38.262797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.763352Z","title":"Teaching on a budget: agents advising agents in reinforcement learn- ing","venue":null,"work_id":"6685a50a-eb60-4945-84d5-38f92116827f","year":2013},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.902315Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:bd1159e97c6cba8c28f7cbbacc865adc8db92b6360acb023f6069715ea9483f3","observation_id":"b0ec105d-082d-40bb-bc08-ef0c9092a0f0","resolution":{"observed_at":"2026-08-04T20:49:38.766821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.752728Z","title":"Simultaneously Learning and Advising in Multiagent Reinforcement Learning","venue":null,"work_id":"ecee3ea6-0cd9-4ada-b43c-a64c474d2f08","year":2017},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.905768Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:3d70cbb13c81ad4d668a8c77d27c45df23856b96889138686b85cac2247f7b01","observation_id":"2db3009c-2e21-4587-a067-103389989162","resolution":{"observed_at":"2026-08-04T20:49:38.756087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-04T20:49:37.908962Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.908962Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:41f4986df056eab9e2bb96b6f3500e65694f6c5f49f3c118dd4a66110a9a77af","observation_id":"4708b46a-adca-41e8-a124-064c92278cf0","resolution":{"observed_at":"2026-08-04T20:49:37.908962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-04T20:49:37.912725Z","title":"Brown et al.Language Models are Few-Shot Learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.912725Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:1d3d6e6c2a43bb4c6adc23803a9512ba913b79ee487658a71899bf24b7c5ca87","observation_id":"df71067c-76a5-43fe-bd15-57f36c7c681f","resolution":{"observed_at":"2026-08-04T20:49:37.912725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-04T20:49:37.916750Z","title":"Cohen.Program of Thoughts Prompting: Dis- entangling Computation from Reasoning for Numerical Reasoning Tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.916750Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:514689170dbdfbb4d09a1aef202b5b07c369fffa308d210df43e01dfbc5f731e","observation_id":"9ceff9e6-c61b-4420-a61f-2df51d321fd0","resolution":{"observed_at":"2026-08-04T20:49:37.916750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.742099Z","title":null,"venue":null,"work_id":"8e3df99c-9e07-4abd-b3c1-a518ff2352c3","year":null},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.920386Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:bbcc7f3d646262457f3dc4c6e3750ddefa8260589f8124117cb7335ed3cc0d1d","observation_id":"c388a109-cd3e-4377-9484-3db35a08d0b8","resolution":{"observed_at":"2026-08-04T20:49:38.745635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.731175Z","title":"Using Ollama","venue":null,"work_id":"d9e5c211-3c9f-4bfb-8318-ad28356b8bf8","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.927393Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:cb18eaf74ba32b0ae42b236e5674ec829afbd3ce26fba88771d5eb97f9fa6e88","observation_id":"3fbc8c99-6316-40d1-a694-bf2e9412fe14","resolution":{"observed_at":"2026-08-04T20:49:38.734303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14826","last_updated":"2026-04-04T00:44:19Z","snapshot_observed_at":"2026-08-06T19:44:15.952593Z","submitted_at":"2024-10-18T18:51:44Z","title":"SPRIG: Improving Large Language Model Performance by System Prompt Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14826","snapshot_observed_at":"2026-08-04T20:49:37.930680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.930680Z"},"links":{"cited_paper":"/paper/2410.14826","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:9aa2f02d4f18a0d747d8276e44a9da3a1ba36c152bd90efaa5d087ea57931cfe","observation_id":"8a031c54-11f9-43b3-9d6b-f8de9eb01719","resolution":{"observed_at":"2026-08-04T20:49:37.930680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-04T20:49:37.933858Z","title":"Schmidt.A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.933858Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:38aaf1038036e8a79c8f4985175b7c26c3c46e3ad9614bbeefb04f009cf51944","observation_id":"dc7b8055-0f57-4de5-ac93-93d04dc9001c","resolution":{"observed_at":"2026-08-04T20:49:37.933858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-04T20:49:37.937179Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.937179Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:cc907fb6cccd29e38387eec4e5da9068791a250b8159e45ff261e3db7e559af4","observation_id":"b19d0852-b7a0-48af-b8f5-a59931772fc7","resolution":{"observed_at":"2026-08-04T20:49:37.937179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17752","last_updated":"2025-05-14T12:22:01Z","snapshot_observed_at":"2026-08-10T01:25:27.640013Z","submitted_at":"2025-01-29T16:41:15Z","title":"On the Partitioning of GPU Power among Multi-Instances","version":2},"cited_work":{"arxiv_id":"2501.17752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17752","snapshot_observed_at":"2026-08-04T20:49:38.178193Z","title":"On the Partitioning of GPU Power among Multi-Instances","venue":"cs.DC","work_id":"c6f15619-b7b1-4b3f-855c-c09752f722ba","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.940585Z"},"links":{"cited_paper":"/paper/2501.17752","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:280278a858e23624f1de02e71324db6fcff47dc95ebf1df56a26eecf60479208","observation_id":"7d6491d8-6382-46ce-8df1-de2c91c42dc9","resolution":{"observed_at":"2026-08-04T20:49:38.182311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T20:49:37.943759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.943759Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:12d50ab3756e578acfb473b53e08e6dc69f17c575c0838039f3f5661e78efcd9","observation_id":"9ca0dc91-adc6-4ea1-84c7-35e27eeb421f","resolution":{"observed_at":"2026-08-04T20:49:37.943759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01727","last_updated":"2023-08-03T12:36:13Z","snapshot_observed_at":"2026-07-06T16:02:07.069777Z","submitted_at":"2023-08-03T12:36:13Z","title":"Local Large Language Models for Complex Structured Medical Tasks","version":1},"cited_work":{"arxiv_id":"2308.01727","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.01727","snapshot_observed_at":"2026-08-04T20:49:38.153635Z","title":"Local Large Language Models for Complex Structured Medical Tasks","venue":"cs.CL","work_id":"c811046c-9a5f-40ee-8450-bf3332728af5","year":2023},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.947200Z"},"links":{"cited_paper":"/paper/2308.01727","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ebf09bc7fb640803e9562b8963df0d587d015073d77867efecddb888e4edef18","observation_id":"839ed5fb-3ec6-4362-8bc4-6d1680a95ca0","resolution":{"observed_at":"2026-08-04T20:49:38.157716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s43856-025-00808-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:49:38.052161Z","title":"Comprehensive testing of large language models for extraction of structured data in pathology","venue":null,"work_id":"f239448d-05f3-48b3-9a48-6f7cc06bd502","year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.950968Z"},"links":{"citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:ec1eb0d1294c8c94636f7ce7064c653fed5ae7ea22f2734d39f465871d622a05","observation_id":"fb9bfbc1-5c07-4cf1-964a-569affae9c8b","resolution":{"observed_at":"2026-08-04T20:49:38.055904Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":5,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":71,"verified_exact":10,"verified_fuzzy":10},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 0 inbound Pith citation observations for arXiv:2509.08329."}