Pith. sign in

Paper Citation Record · LEDGER

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 5 inbound Pith citation observations for arXiv:2505.19761.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19761 v1

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:10:10.212302Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T22:15:13.878078Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T19:36:09.116821Z

Reference resolution

64 of 64 outbound references displayed

  • verified exact0
  • verified fuzzy46
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9d07db5a-7295-42cb-bea6-e8b0e9b31242 · outbound

This paper cites Do as I can, not as I say: Grounding language in robotic affordances.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Do as I can, not as I say: Grounding language in robotic affordances

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:18.210682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.230679Z digest=sha256:0319aef44c30545bc2ff4cabc1374d30680a59775398f754be72a5a07bd20855

Observation a722c448-b34b-4697-9588-f06d6c6dd6c1 · outbound

This paper cites The option-critic architecture.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning The option-critic architecture

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:18.027624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.282851Z digest=sha256:30f2a3b8efc34834f3ec1370689dc6a6977604bf54bb184f1c1de0932b09de0f

Observation d2be6b60-0de8-46f4-9a21-1aef512d2deb · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:02.397659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:02.397659Z digest=sha256:b8baa630a09017b4250553193f062aa8715493c0a504b04fbff18c760e01dea4

Observation 289307af-8d95-485a-974e-6b20dfc44ac0 · outbound

This paper cites D., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., et al

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.898002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.543956Z digest=sha256:179532a6e107b97bcce40227ef6fac2b09aedd996515bb339a813e7d3138f200

Observation 796fa1f8-143f-4981-b713-bcf9fcb9e3c4 · outbound

This paper cites Exploration by random network distillation.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Exploration by random network distillation

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.745625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.640172Z digest=sha256:c0d381b9358127f764c027d4b07a6b4a4e69b59a41f9e4763cdd76e46697d53e

Observation 4e07b629-aa8e-4ecc-a5f4-db57fc4ab08d · outbound

This paper cites FireAct: Toward Language Agent Fine-tuning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning FireAct: Toward Language Agent Fine-tuning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:02.785697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:02.785697Z digest=sha256:8911364197f746b89c9202da7272ab276c2040760cf14ac3e769445f7e262617

Observation 9b6de2aa-24f4-4e91-a5d9-3fefab329281 · outbound

This paper cites AgentVerse : Facilitating multi-agent collaboration and exploring emergent behaviors.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AgentVerse : Facilitating multi-agent collaboration and exploring emergent behaviors

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.537430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.963368Z digest=sha256:31a1e9eb7e1d19f5e0831930a9fb905ccb564e6e300602cc5ac34ec9ce494ecd

Observation d32de7ba-44ca-4ab5-b97d-ec22890804e2 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:10:17.393769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.087942Z digest=sha256:1543f7e58a5fe9b1b3fc490845403a78e6865556006566577f837663be4e08e7

Observation e4be9148-0eb1-43e9-9027-29071750a07c · outbound

This paper cites M., Hao, B., and Van Roy, B.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning M., Hao, B., and Van Roy, B

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.254719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.277623Z digest=sha256:ef76d920a85815b715241bc6f917afa3f7e602ba98f048a6b993c8554a42357d

Observation db524625-8384-4c06-a8fb-106df05b7656 · outbound

This paper cites Off-policy deep reinforcement learning without exploration.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Off-policy deep reinforcement learning without exploration

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.427429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.427429Z digest=sha256:9f57d46a5ffdadbef94ac465dc94853a6b1745d1128ee25b11177f114b9d3906

Observation 7bbc3abe-c7af-42c5-8d23-92ae46e2969b · outbound

This paper cites Strategic Reasoning with Language Models.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Strategic Reasoning with Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.550763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.550763Z digest=sha256:0cf31df9ac1451413d01cc4488be6351b0f835c1aeda492fd6fa930af6e59c77

Observation 6328885d-5939-4bae-8b6e-560f21a47f00 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.622363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.622363Z digest=sha256:941e5926609fa5bf9cd50f0dc04765fb8e73ad6a38ce7d7c455c0822667a5e7e

Observation 8fd853a4-a4a7-4bf4-a975-3bd33e9d9a63 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.721409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.721409Z digest=sha256:a6b9ac696ad919d429be6850f34cbf84ed0e5b7dee6e734976138df715d612a2

Observation 0b40f5b6-f192-4a5e-bde9-97e46e2562ac · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.111830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.885536Z digest=sha256:790754d2b12657bf5fc4dfaec514704bf3dc0f005618108d8cab1cada0ca8d27

Observation 819c0c3a-020b-45fb-b08b-477d2d69551a · outbound

This paper cites J., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning J., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., et al

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.965165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.056340Z digest=sha256:f1df247c6ed33b6a15daea515065f545bc88dba9da78180a6cec54a7a97b7257

Observation 613b845b-1b4d-4796-bece-74af77b6b1e3 · outbound

This paper cites Mistral 7B.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Mistral 7B

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:04.210323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:04.210323Z digest=sha256:3105e1e811623872349e2d26aa51ece731105ae449c7620bb119c00009fb8e4e

Observation f18cde6b-72fc-4d04-965b-ffc3fc988e3b · outbound

This paper cites and Tsitsiklis, J.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Tsitsiklis, J

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.813391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.312190Z digest=sha256:6d1250d2708e7cc933a1b34e6070e84f9f5b070915d283e4f67acd88be8f621f

Observation 0b34ae5e-466c-4a74-8511-892be0c26f13 · outbound

This paper cites Offline reinforcement learning with fisher divergence critic regularization.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline reinforcement learning with fisher divergence critic regularization

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.674617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.475258Z digest=sha256:2d3b19b2db9fb2b103a576f393497e9a683bc127e6c0361de91081e1318f1ce5

Observation 319fa590-4745-4bd9-a996-5baecd7a2daf · outbound

This paper cites Offline reinforcement learning with implicit Q -learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline reinforcement learning with implicit Q -learning

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.498767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.665987Z digest=sha256:992f4369184a52f5a5bcb467e3fe25ed2a60d27048ceb45d873ed8b3d375b52d

Observation a908e7ec-780d-4ac8-aeef-94c2b913ce61 · outbound

This paper cites Conservative q-learning for offline reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Conservative q-learning for offline reinforcement learning

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.363398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.759415Z digest=sha256:77f0d184041f0d01041b5ea8dcb39d2703ef89ce1aec08c2dc80d1119e52f443

Observation 78a1cb6c-17e3-4867-bdc6-02a0c6111f80 · outbound

This paper cites Offline-to-online reinforcement learning via balanced replay and pessimistic Q -ensemble.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline-to-online reinforcement learning via balanced replay and pessimistic Q -ensemble

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.216740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.863409Z digest=sha256:8e01d05dd95b6d7e8d9a848fb0c8e3a145a24d2c5d1e836e28f8340fd64e91d9

Observation 9058df54-5295-4725-90ea-4206a20bccf9 · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:05.005459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:05.005459Z digest=sha256:a5c0171c5cd2ea63bf2f2dddb98328f82c59dbba6790239e043799f9bbda6516

Observation 7b5689fc-12fe-4cb2-a50c-3a77ace1c66f · outbound

This paper cites Learning multi-level hierarchies with hindsight.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Learning multi-level hierarchies with hindsight

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.096283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.168375Z digest=sha256:5bb86fb779c78efa3908113f637013a2ac1f5acf9d0fa662de7b69b5242ec345

Observation 487df6e2-9e17-43f1-a4e9-1eb6f6c52caf · outbound

This paper cites Sub-policy adaptation for hierarchical reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Sub-policy adaptation for hierarchical reinforcement learning

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.944303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.305271Z digest=sha256:25271c780b5e6b041f741d907a8e394b6c338df8d13fb83dc08d21487ae449a2

Observation d53069d9-d50c-46d0-9dcc-8da3b2ef9c00 · outbound

This paper cites Pre-trained language models for interactive decision-making.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Pre-trained language models for interactive decision-making

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.826814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.449975Z digest=sha256:8c74a34729bb85a1c7a063b1cd3608fcd945e4b8ddadfaa205f32f7ca92dd1ac

Observation 3ff69c08-a549-4fb5-b8aa-830304fb34d3 · outbound

This paper cites Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.716059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.555089Z digest=sha256:b877584254e1dded8f4bb08bf1df0c13ec8056e347b6151e021136fb77c63318

Observation 57fd0717-282a-4b0a-ae9a-27b6bedfb48d · outbound

This paper cites Y., Fu, Y., Yang, K., Brahman, F., Huang, S., Bhagavatula, C., Ammanabrolu, P., Choi, Y., and Ren, X.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Y., Fu, Y., Yang, K., Brahman, F., Huang, S., Bhagavatula, C., Ammanabrolu, P., Choi, Y., and Ren, X

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.603802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.728248Z digest=sha256:26fd066c57f62250a243ff985b9b466462d8c87112013497e4bbf8bf4d367413

Observation ae985a6f-8e1c-4c2b-ab7d-149aa6803a82 · outbound

This paper cites WizardCoder : Empowering code large language models with evol-instruct.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning WizardCoder : Empowering code large language models with evol-instruct

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.488970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.837398Z digest=sha256:ef214a4d2c27cb600aace427ec588ab68bf322034fa6873fc8add6102b153176

Observation 7ccabb6a-d1e4-4962-a23a-1c4c0de5c182 · outbound

This paper cites Large language models play StarCraft II : Benchmarks and a chain of summarization approach.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Large language models play StarCraft II : Benchmarks and a chain of summarization approach

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.364202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.007368Z digest=sha256:a2533251845b4aad4e957d8f2dd0d4ac35093062e62148cca9271be835f6e2f3

Observation fcb8a6c0-db08-4d4e-874d-382e06b90512 · outbound

This paper cites Random latent exploration for deep reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Random latent exploration for deep reinforcement learning

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.232748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.132846Z digest=sha256:ddaf5e2d3a66d283d0fab7278c23711e7b18413ef4c4601babdba075cfefe8d4

Observation f9aae58d-80e1-4cee-a254-a3518ae47105 · outbound

This paper cites Introducing Meta Llama 3 : The most capable openly available LLM to date, 2024.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Introducing Meta Llama 3 : The most capable openly available LLM to date, 2024

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.123541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.317145Z digest=sha256:72224fd0eec39122b6779d671b7265c3bffc522a100738c6f74c3dc6fdd24a9b

Observation 29f99d6a-2af5-42a3-a2f9-da319bea9f49 · outbound

This paper cites S., Lee, H., and Levine, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning S., Lee, H., and Levine, S

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.960814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.796178Z digest=sha256:03515c56ccf2bfcfe97d1214fc2a4e889603c509192a6e3c162c148a8a416f06

Observation bc381cf7-0efb-4f86-95dc-7ecc932b2e4f · outbound

This paper cites AWAC: Accelerating Online Reinforcement Learning with Offline Datasets.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:06.985557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:06.985557Z digest=sha256:37bdbfba5ed1df35f1aa8f4231cd2ac0758de9bd2f7d897f45574ac85103c903

Observation 3ace0f39-234c-43ff-af15-f5797e3e83f5 · outbound

This paper cites Training language models to follow instructions with human feedback.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Training language models to follow instructions with human feedback

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.854618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.094830Z digest=sha256:fe73c3b1c4f7e4d701789e184f26fb75381a1c7d457899e3ca688a62c6ff3279

Observation b1de15fc-17b2-4ff3-a9bd-8c415313b8ef · outbound

This paper cites Agent planning with world knowledge model.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Agent planning with world knowledge model

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.736055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.215775Z digest=sha256:b3cb45d2aed32782a5f26d4c6e16f333efcde95d8cc9d38caf0c2e539ff7843f

Observation 4776b385-8e62-47de-be6c-8e28b200137b · outbound

This paper cites D., Ermon, S., and Finn, C.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., Ermon, S., and Finn, C

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.591349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.330924Z digest=sha256:d62b0220742795cc9ebf7c7ff419947a475f78896f8ab8e62e89a6b8e7a53835

Observation 3952f539-f130-45db-85cc-da379d8d9b3e · outbound

This paper cites Vision-language models are zero-shot reward models for reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Vision-language models are zero-shot reward models for reinforcement learning

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.400181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.431665Z digest=sha256:eace18e331ab134e943db5f33fca7595988df9dd2381f4f173c209356744c2f6

Observation 2cc8757b-1210-4607-8608-cc1de01707c5 · outbound

This paper cites LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.259603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.530842Z digest=sha256:b91db133afabc876f8757c3f3d0c0c474a8df71fc14ed6ecd94c6744a8ab8e5c

Observation 89449e9f-520f-42e1-858c-fdd1e180e67a · outbound

This paper cites R., and Yao, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning R., and Yao, S

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.122648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.675518Z digest=sha256:32368f34df8083ce86ab7e61aabc7181eea6b0cfbd723302e2eaf70487569a2f

Observation 4018fc4c-3c74-48ab-b043-127f74412a6d · outbound

This paper cites ALFWorld : Aligning text and embodied environments for interactive learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ALFWorld : Aligning text and embodied environments for interactive learning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.960667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.794874Z digest=sha256:55e14752681583b2b7ba71f6892c384998899e4e5dbf158af70a10d5e605c0ce

Observation 990d2e2e-6975-4aca-bd16-f1b701435349 · outbound

This paper cites J., Guez, A., Sifre, L., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning J., Guez, A., Sifre, L., et al

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.801005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.929050Z digest=sha256:729083b9dd749a9308c835ca010407aafacae9800e9ccc10a7acee90a263ea5d

Observation 7516a701-86be-4265-a00b-2e4f71025de2 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.012224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.012224Z digest=sha256:76a7bb6264f3299448c0ae894599230d9e72c64bb2d350974580410661121352

Observation 1c81e55a-07b8-4f71-aee3-d8adf7f4f5ff · outbound

This paper cites V., Kostrikov, I., Su, Y., Yang, S., and Levine, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., Kostrikov, I., Su, Y., Yang, S., and Levine, S

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.638662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.132385Z digest=sha256:69aaf4f227bfbac39956aadb513ee93219840bd12405ffe5a4e958547e0483fe

Observation e495eefc-6550-4c38-92f0-d13fa9830d83 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:10:13.501201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.280213Z digest=sha256:e886eead8f108a927411c7904c80028405f6cb6a7c3c7b7130120288cb076784

Observation cf82ee6d-9e04-4a2e-a65f-775399f8cedb · outbound

This paper cites S., Precup, D., and Singh, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning S., Precup, D., and Singh, S

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.364536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.367120Z digest=sha256:485abf60df8ea7a247cb60972f93db433955b4c315f9b8407ced904506c1a632

Observation d5382900-7b59-461f-b1dd-80846282a29d · outbound

This paper cites D., and Toshev, A.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., and Toshev, A

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.159958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.442559Z digest=sha256:a2039eb381ef8783548210959a4f5f4bd619f893c696a7987a4b91ace496a1d3

Observation 0101f403-ec39-4b99-84e6-c1ecfc1f4cf3 · outbound

This paper cites True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.992598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.544889Z digest=sha256:4750523234122a157eeeee81e83494f07108952577fc6f05233ac7252ce3be9e

Observation 33c33ad7-14a3-4e3f-86f5-90945701cb48 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Gemma: Open Models Based on Gemini Research and Technology

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.636760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.636760Z digest=sha256:5ff979d98e163c3bc47244eadeef70fdd94849f744787ba362f5150ec39fa41e

Observation 1723885e-f9f5-4c7b-b879-4d449a030dbe · outbound

This paper cites K.-W., and Lim, E.-P.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning K.-W., and Lim, E.-P

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.701162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.712539Z digest=sha256:438f648dff5b2c1af9ebb8dd35f558794024062928574bfc30146e6210834755

Observation 86cd567c-16ef-4247-afda-fe2b444cd59a · outbound

This paper cites ScienceWorld : Is your agent smarter than a 5th grader? In Proceedings of Empirical Methods in Natural Language Processing, pp.\ 11279--11298, 2022.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ScienceWorld : Is your agent smarter than a 5th grader? In Proceedings of Empirical Methods in Natural Language Processing, pp.\ 11279--11298, 2022

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.560024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.839365Z digest=sha256:f318da90ba930bc2e4966b2bb053afe091287d7bda5934316cfa16976705d629

Observation 748cf0a8-fb8c-4516-882a-c84645db6add · outbound

This paper cites Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.942221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.942221Z digest=sha256:8a9988b6639bdfdab78cff8440c9a2d03d5409e607e5b45dd9d9c8916b65aefb

Observation 9255f265-83f0-42d8-93a7-edec033e530a · outbound

This paper cites Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.404091Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.095344Z digest=sha256:2349f992fec2d7bdcff874e24c383efef7935678e5803f47786639ea4a87dbf5

Observation 07a6e097-2acc-417a-9928-e0d07247b6bb · outbound

This paper cites V., Zhou, D., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., Zhou, D., et al

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.201429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.201429Z digest=sha256:b5a2d7ca3a988fa6cdeca28d2cbd7a5d2547eba3d7a51b49672697eb949ec5c0

Observation ddd918c2-3de6-4f56-9bc8-1f16419d28cd · outbound

This paper cites and Jennings, N.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Jennings, N

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.269917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.321787Z digest=sha256:846813e51e1f24c0cfa660bc6ba9c8ac758b7bf837811b704f334127f15edcf2

Observation 2c1f8ae7-6869-4559-94c5-4013f2ab54dd · outbound

This paper cites The Rise and Potential of Large Language Model Based Agents: A Survey.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning The Rise and Potential of Large Language Model Based Agents: A Survey

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.384612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.384612Z digest=sha256:ac8e6426fc0c8cc495e93f3880e815d85edaec9becda6f5974f5863903c9b03f

Observation c70ee563-a50c-4e93-979c-51288df6d0a9 · outbound

This paper cites Language agents with reinforcement learning for strategic play in the werewolf game.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Language agents with reinforcement learning for strategic play in the werewolf game

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.042081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.494820Z digest=sha256:038825074411184962db300e23486d51861305cd2d787c8b538954d1d443f54c

Observation 0185b1c2-0b29-414c-b1c1-c5794eee1498 · outbound

This paper cites L., Cao, Y., and Narasimhan, K.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning L., Cao, Y., and Narasimhan, K

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.794886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.589788Z digest=sha256:ba9cd5814bd6c91ccb51b16adf04c9011095c0bafdc36cf936b31a1ac59de573

Observation 817ec64a-3d18-48ab-9631-d848d3332896 · outbound

This paper cites ReAct : Synergizing reasoning and acting in language models.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ReAct : Synergizing reasoning and acting in language models

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.610093Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.673939Z digest=sha256:65c5d7695579b4764c26dbcce9b37ff15dffd4afae5858383b2910d6eee31109

Observation fc3a4105-8d4c-4a4e-a273-14bf42a0acd4 · outbound

This paper cites and Zhang, X.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Zhang, X

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.419903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.777609Z digest=sha256:9cc982cfafcfa02a1bc27ef56a94df0316bbf6a8bdef89169fcc0f5350cfd064

Observation 48c2b5e5-ade5-4ae1-8b20-498d33b23bb1 · outbound

This paper cites AgentTuning: Enabling Generalized Agent Abilities for LLMs.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AgentTuning: Enabling Generalized Agent Abilities for LLMs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.861270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.861270Z digest=sha256:0a44470167aa90db71d16e7490b8177202d7011170581deb334f19c8fa3362e5

Observation 6a976452-1826-4171-81c3-eabbf5704b52 · outbound

This paper cites Fine-tuning large vision-language models as decision-making agents via reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Fine-tuning large vision-language models as decision-making agents via reinforcement learning

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.152936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.941309Z digest=sha256:d2652bccfce1f856a23c8192c44aa6da6fdc7eb9db180b6625eccaa9c016ff21

Observation fd947cf8-8c63-4b6d-ad67-9eac04d6b612 · outbound

This paper cites V., and Chi, E.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., and Chi, E

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:10.882812Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:10.079649Z digest=sha256:331d9701aad9f03985a63b251ff9c455a0afa07bec473513f154df8fc00c5700

Observation f01e7953-3233-4980-930d-fd6b86528269 · outbound

This paper cites ArCHer : Training language model agents via hierarchical multi-turn rl.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ArCHer : Training language model agents via hierarchical multi-turn rl

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:10.645452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T14:10:10.148144Z digest=sha256:bf4462291954cc9d1fc4e9f44584760e7b1b6df2ce90728203138fca5fe2974a

Observation 957e7a45-d9e3-4f42-9ef8-5939a58610e6 · outbound

This paper cites write newline.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning write newline

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:10.212302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:10.212302Z digest=sha256:beb39ce44e75c2278be6625178c0d5d0e6fc2fc1a9db23e10f7510baf89e606d

Pith citing papers

Observation 78f0ead6-0e63-42c4-9531-88f652aca04e · inbound

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory cites this paper.

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 226

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T23:13:15.620491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-14T23:13:15.016486Z digest=sha256:8fde86bb51edbfe9512b18aec9f1ed03c071669ba36f76ded563f5cf4a84af2b

Observation 9085988c-cfee-4f5c-9c20-28609aaea7a6 · inbound

Agentic Reasoning for Large Language Models cites this paper.

Agentic Reasoning for Large Language Models Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 131

Resolution
verified exact
arxiv_id, observed 2026-05-17T15:14:26.096893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-17T15:14:25.558878Z digest=sha256:6eaa28962b0f22779c36ef2701fbabdbcf125f2c1a688e11f66f346ee0e35bb3

Observation 3ee393cc-93e7-424b-a369-c7cbf8af333f · inbound

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents cites this paper.

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T18:36:28.440409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-15T18:35:45.900606Z digest=sha256:c2550146d0197b6ed555defbdba8bfe08df8f800ffa33f6ac34768a8192f930a

Observation 68d5c6ab-a654-4ac0-becd-bec365c45249 · inbound

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading cites this paper.

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:26:05.986088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-09T17:08:46.405278Z digest=sha256:3445af33f2b5fe4137887023af2be3688adb5f2bb7ceba0599b85d7885568524

Observation 14b9cd96-96f3-4b2a-864d-29f7400d0a09 · inbound

DeSQ: Decomposition-based SPARQL Query Generation cites this paper.

DeSQ: Decomposition-based SPARQL Query Generation Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 57

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T19:36:09.118286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-28T22:15:13.878078Z digest=sha256:bc047426925866da95ae9e6ca35fb6a27bb628bfa290270e48f7b7df877a8274