{"as_of":"2026-08-08T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b0050e4dfb4df94c93b6a33432c3398564fd90cb0843bffb15a03c2ac4a07f2","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:10:10.212302Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:15:13.878078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T19:36:09.116821Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19761","snapshot_observed_at":"2026-07-01T19:36:09.116821Z","title":"Divide and conquer: Grounding llms as efficient decision-making agents via offline hierarchical reinforcement learning","venue":null,"work_id":"ade7f252-c7a6-4fc0-b43b-f6120de826af","year":2025},"citing_paper":{"arxiv_id":"2511.20857","last_updated":"2026-05-18T16:18:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T21:08:07Z","title":"Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory","version":1},"reference_index":226,"source":"arxiv_source","source_observed_at":"2026-05-14T23:13:15.016486Z"},"links":{"cited_paper":"/paper/2505.19761","citing_paper":"/paper/2511.20857"},"observation_digest":"sha256:b33ae2b8a996606a5f3217a027db1204a1d4e4e600c5218c0bd5bebe6120545c","observation_id":"78f0ead6-0e63-42c4-9531-88f652aca04e","resolution":{"observed_at":"2026-05-14T23:13:15.620491Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19761","snapshot_observed_at":"2026-07-01T19:36:09.116821Z","title":"Divide and conquer: Grounding llms as efficient decision-making agents via offline hierarchical reinforcement learning","venue":null,"work_id":"ade7f252-c7a6-4fc0-b43b-f6120de826af","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2505.19761","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:17fd1ac1a0009e3dc1e7d63c5dfd9d05226ad8ee59559dddf3d127fc8a773b3b","observation_id":"9085988c-cfee-4f5c-9c20-28609aaea7a6","resolution":{"observed_at":"2026-05-17T15:14:26.096893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19761","snapshot_observed_at":"2026-07-01T19:36:09.116821Z","title":"Divide and conquer: Grounding llms as efficient decision-making agents via offline hierarchical reinforcement learning","venue":null,"work_id":"ade7f252-c7a6-4fc0-b43b-f6120de826af","year":2025},"citing_paper":{"arxiv_id":"2603.00977","last_updated":"2026-05-05T03:37:16Z","snapshot_observed_at":"2026-08-02T14:44:32.701926Z","submitted_at":"2026-03-01T08:09:03Z","title":"HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T18:35:45.900606Z"},"links":{"cited_paper":"/paper/2505.19761","citing_paper":"/paper/2603.00977"},"observation_digest":"sha256:af82676c2cd7418a15e4dc7ebad4c3de126fc9ee53527fc12b34eece4489a023","observation_id":"3ee393cc-93e7-424b-a369-c7cbf8af333f","resolution":{"observed_at":"2026-05-15T18:36:28.440409Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19761","snapshot_observed_at":"2026-07-01T19:36:09.116821Z","title":"Divide and conquer: Grounding llms as efficient decision-making agents via offline hierarchical reinforcement learning","venue":null,"work_id":"ade7f252-c7a6-4fc0-b43b-f6120de826af","year":2025},"citing_paper":{"arxiv_id":"2605.01954","last_updated":"2026-05-03T16:37:52Z","snapshot_observed_at":"2026-07-06T23:15:07.159340Z","submitted_at":"2026-05-03T16:37:52Z","title":"Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T17:08:46.405278Z"},"links":{"cited_paper":"/paper/2505.19761","citing_paper":"/paper/2605.01954"},"observation_digest":"sha256:96bee2389296813431bf8d8436093fbd993035d82bef453651d8d95539846c68","observation_id":"68d5c6ab-a654-4ac0-becd-bec365c45249","resolution":{"observed_at":"2026-05-11T16:26:05.986088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.19761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19761","snapshot_observed_at":"2026-07-01T19:36:09.116821Z","title":"Divide and conquer: Grounding llms as efficient decision-making agents via offline hierarchical reinforcement learning","venue":null,"work_id":"ade7f252-c7a6-4fc0-b43b-f6120de826af","year":2025},"citing_paper":{"arxiv_id":"2606.00203","last_updated":"2026-05-29T17:29:15Z","snapshot_observed_at":"2026-08-01T03:32:25.296095Z","submitted_at":"2026-05-29T17:29:15Z","title":"DeSQ: Decomposition-based SPARQL Query Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T22:15:13.878078Z"},"links":{"cited_paper":"/paper/2505.19761","citing_paper":"/paper/2606.00203"},"observation_digest":"sha256:4fc1caea18b240c32ca1395f29b59596cee19dfa841b1ced4e97f94d3ae97b9e","observation_id":"14b9cd96-96f3-4b2a-864d-29f7400d0a09","resolution":{"observed_at":"2026-07-01T19:36:09.118286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19761/citation-record","integrity":"/paper/2505.19761/integrity","json":"/paper/2505.19761/citation-record.json","paper":"/paper/2505.19761"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:18.094913Z","title":"Do as I can, not as I say: Grounding language in robotic affordances","venue":null,"work_id":"70bc49b6-7fe7-4a8a-9b94-3f6599e96cad","year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:02.230679Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:de92f9aa1a44f1441b052f2e6b3c0c0a166274ef6f616c7dfae2e03280904254","observation_id":"9d07db5a-7295-42cb-bea6-e8b0e9b31242","resolution":{"observed_at":"2026-08-07T14:10:18.210682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.962583Z","title":"The option-critic architecture","venue":null,"work_id":"815363f7-1ae0-493e-8cd9-58c355bd4190","year":2017},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:02.282851Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:dce7b0910bccd89a82e328ae910a265f6c53ac4730be937ac3ea762089024d4b","observation_id":"a722c448-b34b-4697-9588-f06d6c6dd6c1","resolution":{"observed_at":"2026-08-07T14:10:18.027624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T14:10:02.397659Z","title":"_0 : A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:02.397659Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:b8baa630a09017b4250553193f062aa8715493c0a504b04fbff18c760e01dea4","observation_id":"d2be6b60-0de8-46f4-9a21-1aef512d2deb","resolution":{"observed_at":"2026-08-07T14:10:02.397659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.825354Z","title":"D., et al","venue":null,"work_id":"6f5668c4-9e9e-46c5-9e60-de1ab75fa1df","year":1901},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:02.543956Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:acc9d33873855a1635a800a2c8860845ae1021c61d935da29eb5d803b58e17a2","observation_id":"289307af-8d95-485a-974e-6b20dfc44ac0","resolution":{"observed_at":"2026-08-07T14:10:17.898002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.654035Z","title":"Exploration by random network distillation","venue":null,"work_id":"a6ca47fd-12ab-4dcd-87fa-21fea79df6c9","year":2019},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:02.640172Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:335b819d2679a17f4d83a9ca05f5846a6d4572b8411e68e889d6946a3d6a379c","observation_id":"796fa1f8-143f-4981-b713-bcf9fcb9e3c4","resolution":{"observed_at":"2026-08-07T14:10:17.745625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-05T18:32:49.850038Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-07T14:10:02.785697Z","title":"FireAct : Toward language agent fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:02.785697Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:8911364197f746b89c9202da7272ab276c2040760cf14ac3e769445f7e262617","observation_id":"4e07b629-aa8e-4ecc-a5f4-db57fc4ab08d","resolution":{"observed_at":"2026-08-07T14:10:02.785697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.468005Z","title":"AgentVerse : Facilitating multi-agent collaboration and exploring emergent behaviors","venue":null,"work_id":"886fa861-2ec9-4764-a43d-5dd749724f52","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:02.963368Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:0dce845185ce92df743abb8df3c8705adfa0b55ea2aab94a1721d3280c5f1074","observation_id":"9b6de2aa-24f4-4e91-a5d9-3fefab329281","resolution":{"observed_at":"2026-08-07T14:10:17.537430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.341491Z","title":null,"venue":null,"work_id":"9878d89a-8c59-4d8b-9f1b-d423a8214bcc","year":2000},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:03.087942Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:487a74bb93a47e245a3b712991c0febb611355e66912bc161b86dd3a987c55e4","observation_id":"d32de7ba-44ca-4ab5-b97d-ec22890804e2","resolution":{"observed_at":"2026-08-07T14:10:17.393769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.189923Z","title":"M., Hao, B., and Van Roy, B","venue":null,"work_id":"2794c350-7b79-45db-93f2-37243834ead7","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:03.277623Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:914a490a0bf59f6c01ed2b4eb3dee3e7a03959b5f26aebb2f8f0c68d167864e2","observation_id":"e4be9148-0eb1-43e9-9027-29071750a07c","resolution":{"observed_at":"2026-08-07T14:10:17.254719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:03.427429Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:03.427429Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:9f57d46a5ffdadbef94ac465dc94853a6b1745d1128ee25b11177f114b9d3906","observation_id":"db524625-8384-4c06-a8fb-106df05b7656","resolution":{"observed_at":"2026-08-07T14:10:03.427429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19165","last_updated":"2023-05-30T16:09:19Z","snapshot_observed_at":"2026-07-06T15:35:30.017377Z","submitted_at":"2023-05-30T16:09:19Z","title":"Strategic Reasoning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19165","snapshot_observed_at":"2026-08-07T14:10:03.550763Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:03.550763Z"},"links":{"cited_paper":"/paper/2305.19165","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:0cf31df9ac1451413d01cc4488be6351b0f835c1aeda492fd6fa930af6e59c77","observation_id":"7bbc3abe-c7af-42c5-8d23-92ae46e2969b","resolution":{"observed_at":"2026-08-07T14:10:03.550763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T14:10:03.622363Z","title":"Deepseek-coder: When the large language model meets programming--the rise of code intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:03.622363Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:941e5926609fa5bf9cd50f0dc04765fb8e73ad6a38ce7d7c455c0822667a5e7e","observation_id":"6328885d-5939-4bae-8b6e-560f21a47f00","resolution":{"observed_at":"2026-08-07T14:10:03.622363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:10:03.721409Z","title":"DeepSeek-R1 : Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:03.721409Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:a6b9ac696ad919d429be6850f34cbf84ed0e5b7dee6e734976138df715d612a2","observation_id":"8fd853a4-a4a7-4bf4-a975-3bd33e9d9a63","resolution":{"observed_at":"2026-08-07T14:10:03.721409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.052369Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"e5cc8732-c460-437f-b6d2-a7d72d7b316f","year":2018},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:03.885536Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:b74339e07f24f8745cc0eb510fbc6474d838a92b07fa1422055e3f666e9d0d8e","observation_id":"0b40f5b6-f192-4a5e-bde9-97e46e2562ac","resolution":{"observed_at":"2026-08-07T14:10:17.111830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.889202Z","title":"J., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., et al","venue":null,"work_id":"54a516f4-9082-4bf2-b309-96b62e7f4c03","year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:04.056340Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:5e6c6679ca7aed747a33dee4e3063f92bfcd681ed44ab2f9ebfd41a95f2c58d1","observation_id":"819c0c3a-020b-45fb-b08b-477d2d69551a","resolution":{"observed_at":"2026-08-07T14:10:16.965165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T14:10:04.210323Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:04.210323Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:3105e1e811623872349e2d26aa51ece731105ae449c7620bb119c00009fb8e4e","observation_id":"613b845b-1b4d-4796-bece-74af77b6b1e3","resolution":{"observed_at":"2026-08-07T14:10:04.210323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.761406Z","title":"and Tsitsiklis, J","venue":null,"work_id":"26e1434e-22c8-41d8-b441-7c97d25525dd","year":1999},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:04.312190Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:d0a693b41fe2d49e42117159e3126b8cf75cd73108da0da82327fc9f532ac86d","observation_id":"f18cde6b-72fc-4d04-965b-ffc3fc988e3b","resolution":{"observed_at":"2026-08-07T14:10:16.813391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.598763Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":"16e0f60b-3e54-402a-a3d0-f50bd431cb81","year":2021},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:04.475258Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:a3c52e428b09c8db3ec42d9838c581748797d54f2cce3345dc4ebbcb8202a6f4","observation_id":"0b34ae5e-466c-4a74-8511-892be0c26f13","resolution":{"observed_at":"2026-08-07T14:10:16.674617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.433275Z","title":"Offline reinforcement learning with implicit Q -learning","venue":null,"work_id":"c2df11bb-681d-40e5-94f9-ed662016eec9","year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:04.665987Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:a44089f815720475a7f9950af07bd73a7dea8166feda73a93e9fc04660b0e80c","observation_id":"319fa590-4745-4bd9-a996-5baecd7a2daf","resolution":{"observed_at":"2026-08-07T14:10:16.498767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.301599Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"b2c44cf1-f9a8-43c8-9f5f-c6669e270241","year":2020},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:04.759415Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:98c9c39c71d44070c399b8804ffeb7344bb15f085fd3d26fa7fba0d36fcb2bb2","observation_id":"a908e7ec-780d-4ac8-aeef-94c2b913ce61","resolution":{"observed_at":"2026-08-07T14:10:16.363398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.168939Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic Q -ensemble","venue":null,"work_id":"8bba3a9f-6f45-48a3-bc90-af51d80d5d69","year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:04.863409Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:2820665b205851b36d153298269d18b65dd2765667153d277c7de96f8f1efa1a","observation_id":"78a1cb6c-17e3-4867-bdc6-02a0c6111f80","resolution":{"observed_at":"2026-08-07T14:10:16.216740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T14:10:05.005459Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:05.005459Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:a5c0171c5cd2ea63bf2f2dddb98328f82c59dbba6790239e043799f9bbda6516","observation_id":"9058df54-5295-4725-90ea-4206a20bccf9","resolution":{"observed_at":"2026-08-07T14:10:05.005459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.010260Z","title":"Learning multi-level hierarchies with hindsight","venue":null,"work_id":"80a4d421-5f3a-41f8-88e1-eff3685bdbc6","year":2019},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:05.168375Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:7e90dd535e0baf474e6efde87f6c464b47392d028f10791306d47bcddbb52ff0","observation_id":"7b5689fc-12fe-4cb2-a50c-3a77ace1c66f","resolution":{"observed_at":"2026-08-07T14:10:16.096283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.882691Z","title":"Sub-policy adaptation for hierarchical reinforcement learning","venue":null,"work_id":"990e7e50-4f19-4d76-ae97-607a82ec9ef5","year":2020},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:05.305271Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:cea46905fe6ddb4c2e661962963190c31338baa21cec9bcd9bb4f563d5033e21","observation_id":"487df6e2-9e17-43f1-a4e9-1eb6f6c52caf","resolution":{"observed_at":"2026-08-07T14:10:15.944303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.789116Z","title":"Pre-trained language models for interactive decision-making","venue":null,"work_id":"30aea2a0-555a-4f5f-8c6c-a89e341de72b","year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:05.449975Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:12b7f54a0cdccce289ff67f578ec5cb396ba7baf12e24f3d803cca7a46926d25","observation_id":"d53069d9-d50c-46d0-9dcc-8da3b2ef9c00","resolution":{"observed_at":"2026-08-07T14:10:15.826814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.674010Z","title":"Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks","venue":null,"work_id":"327acb66-2f09-4793-9196-52d6dcfc5ab2","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:05.555089Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:fd21ff5b30170483f57602cd28e2113cafac1aea83fbaac74872c4d599683dfe","observation_id":"3ff69c08-a549-4fb5-b8aa-830304fb34d3","resolution":{"observed_at":"2026-08-07T14:10:15.716059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.547113Z","title":"Y., Fu, Y., Yang, K., Brahman, F., Huang, S., Bhagavatula, C., Ammanabrolu, P., Choi, Y., and Ren, X","venue":null,"work_id":"302c1425-c702-4dda-9f69-a10a3ea1f396","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:05.728248Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:1123c204518232fac7dc38fcba29776611fe11b604d074cf7fa70360f091b08e","observation_id":"57fd0717-282a-4b0a-ae9a-27b6bedfb48d","resolution":{"observed_at":"2026-08-07T14:10:15.603802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.439154Z","title":"WizardCoder : Empowering code large language models with evol-instruct","venue":null,"work_id":"3840b44a-6956-4b2a-bcad-9998e2b34861","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:05.837398Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:888d45e55db525fc2ed6b95369bf81cf52b9747ba06c89c6f2e7c3c8189175c1","observation_id":"ae985a6f-8e1c-4c2b-ab7d-149aa6803a82","resolution":{"observed_at":"2026-08-07T14:10:15.488970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.307872Z","title":"Large language models play StarCraft II : Benchmarks and a chain of summarization approach","venue":null,"work_id":"7efd5fe5-f4c8-4478-b418-e105369566e6","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:06.007368Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:21697fc790b1fba21df6c0f1172bd5abf4f301e36b768a8bdf3fc86b83262bea","observation_id":"7ccabb6a-d1e4-4962-a23a-1c4c0de5c182","resolution":{"observed_at":"2026-08-07T14:10:15.364202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.182803Z","title":"Random latent exploration for deep reinforcement learning","venue":null,"work_id":"5d01a79d-b3cb-4cce-a722-91bbd6fb5f2e","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:06.132846Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:68cb734a5f6912b2b38d797e5daf6a94a25aee96587ee149a96319a87191ba8b","observation_id":"fcb8a6c0-db08-4d4e-874d-382e06b90512","resolution":{"observed_at":"2026-08-07T14:10:15.232748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.034782Z","title":"Introducing Meta Llama 3 : The most capable openly available LLM to date, 2024","venue":null,"work_id":"d4caf9b9-f565-4f93-8528-3eae2ccfc083","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:06.317145Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:20a387b18834c1a7746ce7560237b28a4f3ff4164a38df70242dc80c50c44141","observation_id":"f9aae58d-80e1-4cee-a254-a3518ae47105","resolution":{"observed_at":"2026-08-07T14:10:15.123541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:14.915963Z","title":"S., Lee, H., and Levine, S","venue":null,"work_id":"476c0e0e-64a6-424a-a423-e36d9e936228","year":2018},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:06.796178Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:ae29b69253a3f73e5882c875b3475b76e87be0236573528fc7db2e0e6882b8a9","observation_id":"29f99d6a-2af5-42a3-a2f9-da319bea9f49","resolution":{"observed_at":"2026-08-07T14:10:14.960814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T14:10:06.985557Z","title":"AWAC : Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:06.985557Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:37bdbfba5ed1df35f1aa8f4231cd2ac0758de9bd2f7d897f45574ac85103c903","observation_id":"bc381cf7-0efb-4f86-95dc-7ecc932b2e4f","resolution":{"observed_at":"2026-08-07T14:10:06.985557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:14.794792Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"35704fd6-512a-4004-a78d-0a2e57253dbb","year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.094830Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:7693cba8340f003dee27298ff56f441482557d5cce14eae5641b826c1e7be6e9","observation_id":"3ace0f39-234c-43ff-af15-f5797e3e83f5","resolution":{"observed_at":"2026-08-07T14:10:14.854618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:14.671368Z","title":"Agent planning with world knowledge model","venue":null,"work_id":"f89f4eaa-dd4b-4d05-97b2-19009283b8da","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.215775Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:fceaadbfdbc810fdd178b1b7f79bd63f145c503cc60416010a6c7294761fc9f3","observation_id":"b1de15fc-17b2-4ff3-a9bd-8c415313b8ef","resolution":{"observed_at":"2026-08-07T14:10:14.736055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:14.503355Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"972503b0-c3c9-44f5-96ce-5ea1e1187610","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.330924Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:6a3af5de06a4409018bf4a974019a4ecb4c329afbbe3cbaa813318d82da5a8df","observation_id":"4776b385-8e62-47de-be6c-8e28b200137b","resolution":{"observed_at":"2026-08-07T14:10:14.591349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:14.335574Z","title":"Vision-language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":"bac8e294-f38d-4e12-a689-d3b25681faa7","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.431665Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:9b1bab050a541c3f4aee6093a22cece028f9e447a9f4b691311b65bfc9a8812c","observation_id":"3952f539-f130-45db-85cc-da379d8d9b3e","resolution":{"observed_at":"2026-08-07T14:10:14.400181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:14.197681Z","title":"LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action","venue":null,"work_id":"20ac1ab1-a44c-4569-9b36-f93ba4f3c58b","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.530842Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:17d3cb6ad52a0d7172e9e5c2426ac6e09986a3fc3cb99683cb2c1c58b33a263b","observation_id":"2cc8757b-1210-4607-8608-cc1de01707c5","resolution":{"observed_at":"2026-08-07T14:10:14.259603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:14.060840Z","title":"R., and Yao, S","venue":null,"work_id":"5565bbe2-1702-41cb-a1f2-20cf2478f36d","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.675518Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:6b895b6a31d1c93c340fa6855362d2b3f9c3759dadaa6ab3b0c92284085994e5","observation_id":"89449e9f-520f-42e1-858c-fdd1e180e67a","resolution":{"observed_at":"2026-08-07T14:10:14.122648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:13.885589Z","title":"ALFWorld : Aligning text and embodied environments for interactive learning","venue":null,"work_id":"5bc57495-e1ab-4aba-ab1e-d4aae106e861","year":2021},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.794874Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:10f9b1f93e8b2a4784c6e6b7a90bb35d5973dd299f43582fd2a83180937ad266","observation_id":"4018fc4c-3c74-48ab-b043-127f74412a6d","resolution":{"observed_at":"2026-08-07T14:10:13.960667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:13.744436Z","title":"J., Guez, A., Sifre, L., et al","venue":null,"work_id":"918d88f4-5848-4d6b-8bf8-f94b3298d1a1","year":2016},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:07.929050Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:474b467923362a7e1383a4448548450c36cc41bf65ca8061c09aec7da8b07631","observation_id":"990d2e2e-6975-4aca-bd16-f1b701435349","resolution":{"observed_at":"2026-08-07T14:10:13.801005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:08.012224Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.012224Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:76a7bb6264f3299448c0ae894599230d9e72c64bb2d350974580410661121352","observation_id":"7516a701-86be-4265-a00b-2e4f71025de2","resolution":{"observed_at":"2026-08-07T14:10:08.012224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:13.560246Z","title":"V., Kostrikov, I., Su, Y., Yang, S., and Levine, S","venue":null,"work_id":"b880b903-6d59-49c5-8884-f41efb92e338","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.132385Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:5ce399c435ec70ff3ac8dd007243f3376029bd2fbcd31b867ebb3432cf17e618","observation_id":"1c81e55a-07b8-4f71-aee3-d8adf7f4f5ff","resolution":{"observed_at":"2026-08-07T14:10:13.638662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:13.424230Z","title":null,"venue":null,"work_id":"ea2a468b-b781-4259-b92f-a86653f40260","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.280213Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:f094e3764898a7fe78f336d32dbfa95d0deac64ac654f9336297844311e73974","observation_id":"e495eefc-6550-4c38-92f0-d13fa9830d83","resolution":{"observed_at":"2026-08-07T14:10:13.501201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:13.269036Z","title":"S., Precup, D., and Singh, S","venue":null,"work_id":"5f870835-0a0a-4eeb-a57f-2d773e41709e","year":1999},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.367120Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:625dbb91a6c491d9079cdb4101adb2256475fcb4a3b9a35b497d46c66f752d89","observation_id":"cf82ee6d-9e04-4a2e-a65f-775399f8cedb","resolution":{"observed_at":"2026-08-07T14:10:13.364536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:13.078063Z","title":"D., and Toshev, A","venue":null,"work_id":"101239ce-59d3-400a-a4a7-def1cec24f9f","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.442559Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:b50373b0239c4836387920cff61113832bb5b9d398ca8e6503a818c39db80ffb","observation_id":"d5382900-7b59-461f-b1dd-80846282a29d","resolution":{"observed_at":"2026-08-07T14:10:13.159958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:12.800549Z","title":"True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning","venue":null,"work_id":"b89255f5-aa97-435a-a33c-f224518eda2e","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.544889Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:05787b1092baf26ba041a08f17d4e93b5d1d827ec9935f37879df89a204d7f12","observation_id":"0101f403-ec39-4b99-84e6-c1ecfc1f4cf3","resolution":{"observed_at":"2026-08-07T14:10:12.992598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T14:10:08.636760Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.636760Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:5ff979d98e163c3bc47244eadeef70fdd94849f744787ba362f5150ec39fa41e","observation_id":"33c33ad7-14a3-4e3f-86f5-90945701cb48","resolution":{"observed_at":"2026-08-07T14:10:08.636760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:12.648509Z","title":"K.-W., and Lim, E.-P","venue":null,"work_id":"6b2b10b2-4bb3-4b2f-aac1-ae11aec6a000","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.712539Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:e20e6ea7989ccacc23ad86c6aaa1b96fd2105a015e528b01b5802ba7dfe3175a","observation_id":"1723885e-f9f5-4c7b-b879-4d449a030dbe","resolution":{"observed_at":"2026-08-07T14:10:12.701162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:12.478976Z","title":"ScienceWorld : Is your agent smarter than a 5th grader? In Proceedings of Empirical Methods in Natural Language Processing, pp.\\ 11279--11298, 2022","venue":null,"work_id":"10328961-10e9-4fc8-8081-ae91e299a373","year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.839365Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:e73d166cb4c1502bb06a6d5604f64d58e93b2d170ccb9602ce1c75bcec918e49","observation_id":"86cd567c-16ef-4247-afda-fe2b444cd59a","resolution":{"observed_at":"2026-08-07T14:10:12.560024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11651","last_updated":"2024-04-16T11:41:13Z","snapshot_observed_at":"2026-07-06T17:31:50.029722Z","submitted_at":"2024-02-18T17:10:07Z","title":"Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11651","snapshot_observed_at":"2026-08-07T14:10:08.942221Z","title":"Learning from failure: Integrating negative examples when fine-tuning large language models as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:08.942221Z"},"links":{"cited_paper":"/paper/2402.11651","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:8a9988b6639bdfdab78cff8440c9a2d03d5409e607e5b45dd9d9c8916b65aefb","observation_id":"748cf0a8-fb8c-4516-882a-c84645db6add","resolution":{"observed_at":"2026-08-07T14:10:08.942221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:12.352784Z","title":"Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning","venue":null,"work_id":"8b33b7e0-5bde-4a3c-8d37-9908fdbb522d","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.095344Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:5593194fa2248288488409a5c8e0ce4f85d149503fb2cd00c2ead4575bdc9428","observation_id":"9255f265-83f0-42d8-93a7-edec033e530a","resolution":{"observed_at":"2026-08-07T14:10:12.404091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:09.201429Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.201429Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:b5a2d7ca3a988fa6cdeca28d2cbd7a5d2547eba3d7a51b49672697eb949ec5c0","observation_id":"07a6e097-2acc-417a-9928-e0d07247b6bb","resolution":{"observed_at":"2026-08-07T14:10:09.201429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:12.164772Z","title":"and Jennings, N","venue":null,"work_id":"5ee88a57-70cd-4fac-ad98-1775ec821de2","year":1995},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.321787Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:e660f39bdcd5b8d67852176bf2573ef3aeafb4ea0dc73ceff58668b9fde1045b","observation_id":"ddd918c2-3de6-4f56-9bc8-1f16419d28cd","resolution":{"observed_at":"2026-08-07T14:10:12.269917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-07T14:10:09.384612Z","title":"The rise and potential of large language model based agents: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.384612Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:ac8e6426fc0c8cc495e93f3880e815d85edaec9becda6f5974f5863903c9b03f","observation_id":"2c1f8ae7-6869-4559-94c5-4013f2ab54dd","resolution":{"observed_at":"2026-08-07T14:10:09.384612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:11.939187Z","title":"Language agents with reinforcement learning for strategic play in the werewolf game","venue":null,"work_id":"643859aa-cfed-4d06-a5ae-775daf36d505","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.494820Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:e191bb205aa07b5e521e8badad74dc099464beae2c51a8a78e11a8574cd36c4e","observation_id":"c70ee563-a50c-4e93-979c-51288df6d0a9","resolution":{"observed_at":"2026-08-07T14:10:12.042081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:11.696555Z","title":"L., Cao, Y., and Narasimhan, K","venue":null,"work_id":"3e537c7a-8a56-4ad1-aa23-57c27e0be7e8","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.589788Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:55b89844e0113c7111c9243b19e6906b6b461ce50f5f4c70d28361069026a418","observation_id":"0185b1c2-0b29-414c-b1c1-c5794eee1498","resolution":{"observed_at":"2026-08-07T14:10:11.794886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:11.537386Z","title":"ReAct : Synergizing reasoning and acting in language models","venue":null,"work_id":"d434af13-36c9-48ba-8d62-3feb06e069a8","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.673939Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:58f64d191e10699dcdead1ee7eb45cf330122db215f4957c10f77f9a21193219","observation_id":"817ec64a-3d18-48ab-9631-d848d3332896","resolution":{"observed_at":"2026-08-07T14:10:11.610093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:11.311805Z","title":"and Zhang, X","venue":null,"work_id":"cc5e1bd7-9344-4195-812e-ede352c59594","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.777609Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:bd4484856e77af8c0b24cb02c4a5e25dc73fb9845bf6eb02aea1bf7ceff60e6c","observation_id":"fc3a4105-8d4c-4a4e-a273-14bf42a0acd4","resolution":{"observed_at":"2026-08-07T14:10:11.419903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-07T22:31:11.195198Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-07T14:10:09.861270Z","title":"AgentTuning : Enabling generalized agent abilities for LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.861270Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:0a44470167aa90db71d16e7490b8177202d7011170581deb334f19c8fa3362e5","observation_id":"48c2b5e5-ade5-4ae1-8b20-498d33b23bb1","resolution":{"observed_at":"2026-08-07T14:10:09.861270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:11.009636Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning","venue":null,"work_id":"a1cd2957-2378-4086-bab2-e8f5386f0aad","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:09.941309Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:e859dbef83bd7c3c262ae14246825d07fc53275ce4dd7a9eb4068cd277a3cc1e","observation_id":"6a976452-1826-4171-81c3-eabbf5704b52","resolution":{"observed_at":"2026-08-07T14:10:11.152936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:10.777567Z","title":"V., and Chi, E","venue":null,"work_id":"b75c9ba5-e08c-44bf-9840-390308c85fac","year":2023},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:10.079649Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:ff23fbfb8fcaa6e36790d57e3084a0e8c59df10e8b59e147ce101dfd7fc74834","observation_id":"fd947cf8-8c63-4b6d-ad67-9eac04d6b612","resolution":{"observed_at":"2026-08-07T14:10:10.882812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:10.522047Z","title":"ArCHer : Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"e28a22d3-ad76-45d3-9806-8669d00e7b5b","year":2024},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:10.148144Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:fbb6a4d3cff79a7a38b20ec8272d68ea2f70ae37d21163714c9d1f226d219e44","observation_id":"f01e7953-3233-4980-930d-fd6b86528269","resolution":{"observed_at":"2026-08-07T14:10:10.645452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:10.212302Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:10.212302Z"},"links":{"citing_paper":"/paper/2505.19761"},"observation_digest":"sha256:beb39ce44e75c2278be6625178c0d5d0e6fc2fc1a9db23e10f7510baf89e606d","observation_id":"957e7a45-d9e3-4f42-9ef8-5939a58610e6","resolution":{"observed_at":"2026-08-07T14:10:10.212302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19761","last_updated":"2025-05-26T09:43:40Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T22:31:47.644433Z","submitted_at":"2025-05-26T09:43:40Z","title":"Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 5 inbound Pith citation observations for arXiv:2505.19761."}