Pith. sign in

Paper Citation Record · LEDGER

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 5 inbound Pith citation observations for arXiv:2505.19761.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19761 v1

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:10:10.212302Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T22:15:13.878078Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T19:36:09.116821Z

Reference resolution

64 of 64 outbound references displayed

  • verified exact0
  • verified fuzzy46
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9d07db5a-7295-42cb-bea6-e8b0e9b31242 · outbound

This paper cites Do as I can, not as I say: Grounding language in robotic affordances.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Do as I can, not as I say: Grounding language in robotic affordances

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:18.210682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.230679Z digest=sha256:de92f9aa1a44f1441b052f2e6b3c0c0a166274ef6f616c7dfae2e03280904254

Observation a722c448-b34b-4697-9588-f06d6c6dd6c1 · outbound

This paper cites The option-critic architecture.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning The option-critic architecture

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:18.027624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.282851Z digest=sha256:dce7b0910bccd89a82e328ae910a265f6c53ac4730be937ac3ea762089024d4b

Observation d2be6b60-0de8-46f4-9a21-1aef512d2deb · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:02.397659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:02.397659Z digest=sha256:b8baa630a09017b4250553193f062aa8715493c0a504b04fbff18c760e01dea4

Observation 289307af-8d95-485a-974e-6b20dfc44ac0 · outbound

This paper cites D., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., et al

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.898002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.543956Z digest=sha256:acc9d33873855a1635a800a2c8860845ae1021c61d935da29eb5d803b58e17a2

Observation 796fa1f8-143f-4981-b713-bcf9fcb9e3c4 · outbound

This paper cites Exploration by random network distillation.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Exploration by random network distillation

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.745625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.640172Z digest=sha256:335b819d2679a17f4d83a9ca05f5846a6d4572b8411e68e889d6946a3d6a379c

Observation 4e07b629-aa8e-4ecc-a5f4-db57fc4ab08d · outbound

This paper cites FireAct: Toward Language Agent Fine-tuning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning FireAct: Toward Language Agent Fine-tuning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:02.785697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:02.785697Z digest=sha256:8911364197f746b89c9202da7272ab276c2040760cf14ac3e769445f7e262617

Observation 9b6de2aa-24f4-4e91-a5d9-3fefab329281 · outbound

This paper cites AgentVerse : Facilitating multi-agent collaboration and exploring emergent behaviors.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AgentVerse : Facilitating multi-agent collaboration and exploring emergent behaviors

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.537430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:02.963368Z digest=sha256:0dce845185ce92df743abb8df3c8705adfa0b55ea2aab94a1721d3280c5f1074

Observation d32de7ba-44ca-4ab5-b97d-ec22890804e2 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:10:17.393769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.087942Z digest=sha256:487a74bb93a47e245a3b712991c0febb611355e66912bc161b86dd3a987c55e4

Observation e4be9148-0eb1-43e9-9027-29071750a07c · outbound

This paper cites M., Hao, B., and Van Roy, B.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning M., Hao, B., and Van Roy, B

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.254719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.277623Z digest=sha256:914a490a0bf59f6c01ed2b4eb3dee3e7a03959b5f26aebb2f8f0c68d167864e2

Observation db524625-8384-4c06-a8fb-106df05b7656 · outbound

This paper cites Off-policy deep reinforcement learning without exploration.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Off-policy deep reinforcement learning without exploration

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.427429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.427429Z digest=sha256:9f57d46a5ffdadbef94ac465dc94853a6b1745d1128ee25b11177f114b9d3906

Observation 7bbc3abe-c7af-42c5-8d23-92ae46e2969b · outbound

This paper cites Strategic Reasoning with Language Models.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Strategic Reasoning with Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.550763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.550763Z digest=sha256:0cf31df9ac1451413d01cc4488be6351b0f835c1aeda492fd6fa930af6e59c77

Observation 6328885d-5939-4bae-8b6e-560f21a47f00 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.622363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.622363Z digest=sha256:941e5926609fa5bf9cd50f0dc04765fb8e73ad6a38ce7d7c455c0822667a5e7e

Observation 8fd853a4-a4a7-4bf4-a975-3bd33e9d9a63 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:03.721409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:03.721409Z digest=sha256:a6b9ac696ad919d429be6850f34cbf84ed0e5b7dee6e734976138df715d612a2

Observation 0b40f5b6-f192-4a5e-bde9-97e46e2562ac · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:17.111830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:03.885536Z digest=sha256:b74339e07f24f8745cc0eb510fbc6474d838a92b07fa1422055e3f666e9d0d8e

Observation 819c0c3a-020b-45fb-b08b-477d2d69551a · outbound

This paper cites J., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning J., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., et al

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.965165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.056340Z digest=sha256:5e6c6679ca7aed747a33dee4e3063f92bfcd681ed44ab2f9ebfd41a95f2c58d1

Observation 613b845b-1b4d-4796-bece-74af77b6b1e3 · outbound

This paper cites Mistral 7B.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Mistral 7B

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:04.210323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:04.210323Z digest=sha256:3105e1e811623872349e2d26aa51ece731105ae449c7620bb119c00009fb8e4e

Observation f18cde6b-72fc-4d04-965b-ffc3fc988e3b · outbound

This paper cites and Tsitsiklis, J.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Tsitsiklis, J

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.813391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.312190Z digest=sha256:d0a693b41fe2d49e42117159e3126b8cf75cd73108da0da82327fc9f532ac86d

Observation 0b34ae5e-466c-4a74-8511-892be0c26f13 · outbound

This paper cites Offline reinforcement learning with fisher divergence critic regularization.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline reinforcement learning with fisher divergence critic regularization

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.674617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.475258Z digest=sha256:a3c52e428b09c8db3ec42d9838c581748797d54f2cce3345dc4ebbcb8202a6f4

Observation 319fa590-4745-4bd9-a996-5baecd7a2daf · outbound

This paper cites Offline reinforcement learning with implicit Q -learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline reinforcement learning with implicit Q -learning

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.498767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.665987Z digest=sha256:a44089f815720475a7f9950af07bd73a7dea8166feda73a93e9fc04660b0e80c

Observation a908e7ec-780d-4ac8-aeef-94c2b913ce61 · outbound

This paper cites Conservative q-learning for offline reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Conservative q-learning for offline reinforcement learning

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.363398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.759415Z digest=sha256:98c9c39c71d44070c399b8804ffeb7344bb15f085fd3d26fa7fba0d36fcb2bb2

Observation 78a1cb6c-17e3-4867-bdc6-02a0c6111f80 · outbound

This paper cites Offline-to-online reinforcement learning via balanced replay and pessimistic Q -ensemble.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline-to-online reinforcement learning via balanced replay and pessimistic Q -ensemble

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.216740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:04.863409Z digest=sha256:2820665b205851b36d153298269d18b65dd2765667153d277c7de96f8f1efa1a

Observation 9058df54-5295-4725-90ea-4206a20bccf9 · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:05.005459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:05.005459Z digest=sha256:a5c0171c5cd2ea63bf2f2dddb98328f82c59dbba6790239e043799f9bbda6516

Observation 7b5689fc-12fe-4cb2-a50c-3a77ace1c66f · outbound

This paper cites Learning multi-level hierarchies with hindsight.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Learning multi-level hierarchies with hindsight

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:16.096283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.168375Z digest=sha256:7e90dd535e0baf474e6efde87f6c464b47392d028f10791306d47bcddbb52ff0

Observation 487df6e2-9e17-43f1-a4e9-1eb6f6c52caf · outbound

This paper cites Sub-policy adaptation for hierarchical reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Sub-policy adaptation for hierarchical reinforcement learning

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.944303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.305271Z digest=sha256:cea46905fe6ddb4c2e661962963190c31338baa21cec9bcd9bb4f563d5033e21

Observation d53069d9-d50c-46d0-9dcc-8da3b2ef9c00 · outbound

This paper cites Pre-trained language models for interactive decision-making.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Pre-trained language models for interactive decision-making

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.826814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.449975Z digest=sha256:12b7f54a0cdccce289ff67f578ec5cb396ba7baf12e24f3d803cca7a46926d25

Observation 3ff69c08-a549-4fb5-b8aa-830304fb34d3 · outbound

This paper cites Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.716059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.555089Z digest=sha256:fd21ff5b30170483f57602cd28e2113cafac1aea83fbaac74872c4d599683dfe

Observation 57fd0717-282a-4b0a-ae9a-27b6bedfb48d · outbound

This paper cites Y., Fu, Y., Yang, K., Brahman, F., Huang, S., Bhagavatula, C., Ammanabrolu, P., Choi, Y., and Ren, X.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Y., Fu, Y., Yang, K., Brahman, F., Huang, S., Bhagavatula, C., Ammanabrolu, P., Choi, Y., and Ren, X

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.603802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.728248Z digest=sha256:1123c204518232fac7dc38fcba29776611fe11b604d074cf7fa70360f091b08e

Observation ae985a6f-8e1c-4c2b-ab7d-149aa6803a82 · outbound

This paper cites WizardCoder : Empowering code large language models with evol-instruct.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning WizardCoder : Empowering code large language models with evol-instruct

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.488970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:05.837398Z digest=sha256:888d45e55db525fc2ed6b95369bf81cf52b9747ba06c89c6f2e7c3c8189175c1

Observation 7ccabb6a-d1e4-4962-a23a-1c4c0de5c182 · outbound

This paper cites Large language models play StarCraft II : Benchmarks and a chain of summarization approach.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Large language models play StarCraft II : Benchmarks and a chain of summarization approach

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.364202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.007368Z digest=sha256:21697fc790b1fba21df6c0f1172bd5abf4f301e36b768a8bdf3fc86b83262bea

Observation fcb8a6c0-db08-4d4e-874d-382e06b90512 · outbound

This paper cites Random latent exploration for deep reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Random latent exploration for deep reinforcement learning

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.232748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.132846Z digest=sha256:68cb734a5f6912b2b38d797e5daf6a94a25aee96587ee149a96319a87191ba8b

Observation f9aae58d-80e1-4cee-a254-a3518ae47105 · outbound

This paper cites Introducing Meta Llama 3 : The most capable openly available LLM to date, 2024.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Introducing Meta Llama 3 : The most capable openly available LLM to date, 2024

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:15.123541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.317145Z digest=sha256:20a387b18834c1a7746ce7560237b28a4f3ff4164a38df70242dc80c50c44141

Observation 29f99d6a-2af5-42a3-a2f9-da319bea9f49 · outbound

This paper cites S., Lee, H., and Levine, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning S., Lee, H., and Levine, S

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.960814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:06.796178Z digest=sha256:ae29b69253a3f73e5882c875b3475b76e87be0236573528fc7db2e0e6882b8a9

Observation bc381cf7-0efb-4f86-95dc-7ecc932b2e4f · outbound

This paper cites AWAC: Accelerating Online Reinforcement Learning with Offline Datasets.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:06.985557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:06.985557Z digest=sha256:37bdbfba5ed1df35f1aa8f4231cd2ac0758de9bd2f7d897f45574ac85103c903

Observation 3ace0f39-234c-43ff-af15-f5797e3e83f5 · outbound

This paper cites Training language models to follow instructions with human feedback.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Training language models to follow instructions with human feedback

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.854618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.094830Z digest=sha256:7693cba8340f003dee27298ff56f441482557d5cce14eae5641b826c1e7be6e9

Observation b1de15fc-17b2-4ff3-a9bd-8c415313b8ef · outbound

This paper cites Agent planning with world knowledge model.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Agent planning with world knowledge model

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.736055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.215775Z digest=sha256:fceaadbfdbc810fdd178b1b7f79bd63f145c503cc60416010a6c7294761fc9f3

Observation 4776b385-8e62-47de-be6c-8e28b200137b · outbound

This paper cites D., Ermon, S., and Finn, C.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., Ermon, S., and Finn, C

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.591349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.330924Z digest=sha256:6a3af5de06a4409018bf4a974019a4ecb4c329afbbe3cbaa813318d82da5a8df

Observation 3952f539-f130-45db-85cc-da379d8d9b3e · outbound

This paper cites Vision-language models are zero-shot reward models for reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Vision-language models are zero-shot reward models for reinforcement learning

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.400181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.431665Z digest=sha256:9b1bab050a541c3f4aee6093a22cece028f9e447a9f4b691311b65bfc9a8812c

Observation 2cc8757b-1210-4607-8608-cc1de01707c5 · outbound

This paper cites LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning LM-Nav : Robotic navigation with large pre-trained models of language, vision, and action

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.259603Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.530842Z digest=sha256:17d3cb6ad52a0d7172e9e5c2426ac6e09986a3fc3cb99683cb2c1c58b33a263b

Observation 89449e9f-520f-42e1-858c-fdd1e180e67a · outbound

This paper cites R., and Yao, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning R., and Yao, S

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:14.122648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.675518Z digest=sha256:6b895b6a31d1c93c340fa6855362d2b3f9c3759dadaa6ab3b0c92284085994e5

Observation 4018fc4c-3c74-48ab-b043-127f74412a6d · outbound

This paper cites ALFWorld : Aligning text and embodied environments for interactive learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ALFWorld : Aligning text and embodied environments for interactive learning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.960667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.794874Z digest=sha256:10f9b1f93e8b2a4784c6e6b7a90bb35d5973dd299f43582fd2a83180937ad266

Observation 990d2e2e-6975-4aca-bd16-f1b701435349 · outbound

This paper cites J., Guez, A., Sifre, L., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning J., Guez, A., Sifre, L., et al

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.801005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:07.929050Z digest=sha256:474b467923362a7e1383a4448548450c36cc41bf65ca8061c09aec7da8b07631

Observation 7516a701-86be-4265-a00b-2e4f71025de2 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.012224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.012224Z digest=sha256:76a7bb6264f3299448c0ae894599230d9e72c64bb2d350974580410661121352

Observation 1c81e55a-07b8-4f71-aee3-d8adf7f4f5ff · outbound

This paper cites V., Kostrikov, I., Su, Y., Yang, S., and Levine, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., Kostrikov, I., Su, Y., Yang, S., and Levine, S

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.638662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.132385Z digest=sha256:5ce399c435ec70ff3ac8dd007243f3376029bd2fbcd31b867ebb3432cf17e618

Observation e495eefc-6550-4c38-92f0-d13fa9830d83 · outbound

This paper cites an unresolved cited work.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:10:13.501201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.280213Z digest=sha256:f094e3764898a7fe78f336d32dbfa95d0deac64ac654f9336297844311e73974

Observation cf82ee6d-9e04-4a2e-a65f-775399f8cedb · outbound

This paper cites S., Precup, D., and Singh, S.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning S., Precup, D., and Singh, S

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.364536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.367120Z digest=sha256:625dbb91a6c491d9079cdb4101adb2256475fcb4a3b9a35b497d46c66f752d89

Observation d5382900-7b59-461f-b1dd-80846282a29d · outbound

This paper cites D., and Toshev, A.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning D., and Toshev, A

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:13.159958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.442559Z digest=sha256:b50373b0239c4836387920cff61113832bb5b9d398ca8e6503a818c39db80ffb

Observation 0101f403-ec39-4b99-84e6-c1ecfc1f4cf3 · outbound

This paper cites True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.992598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.544889Z digest=sha256:05787b1092baf26ba041a08f17d4e93b5d1d827ec9935f37879df89a204d7f12

Observation 33c33ad7-14a3-4e3f-86f5-90945701cb48 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Gemma: Open Models Based on Gemini Research and Technology

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.636760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.636760Z digest=sha256:5ff979d98e163c3bc47244eadeef70fdd94849f744787ba362f5150ec39fa41e

Observation 1723885e-f9f5-4c7b-b879-4d449a030dbe · outbound

This paper cites K.-W., and Lim, E.-P.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning K.-W., and Lim, E.-P

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.701162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.712539Z digest=sha256:e20e6ea7989ccacc23ad86c6aaa1b96fd2105a015e528b01b5802ba7dfe3175a

Observation 86cd567c-16ef-4247-afda-fe2b444cd59a · outbound

This paper cites ScienceWorld : Is your agent smarter than a 5th grader? In Proceedings of Empirical Methods in Natural Language Processing, pp.\ 11279--11298, 2022.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ScienceWorld : Is your agent smarter than a 5th grader? In Proceedings of Empirical Methods in Natural Language Processing, pp.\ 11279--11298, 2022

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.560024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:08.839365Z digest=sha256:e73d166cb4c1502bb06a6d5604f64d58e93b2d170ccb9602ce1c75bcec918e49

Observation 748cf0a8-fb8c-4516-882a-c84645db6add · outbound

This paper cites Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:08.942221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:08.942221Z digest=sha256:8a9988b6639bdfdab78cff8440c9a2d03d5409e607e5b45dd9d9c8916b65aefb

Observation 9255f265-83f0-42d8-93a7-edec033e530a · outbound

This paper cites Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.404091Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.095344Z digest=sha256:5593194fa2248288488409a5c8e0ce4f85d149503fb2cd00c2ead4575bdc9428

Observation 07a6e097-2acc-417a-9928-e0d07247b6bb · outbound

This paper cites V., Zhou, D., et al.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., Zhou, D., et al

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.201429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.201429Z digest=sha256:b5a2d7ca3a988fa6cdeca28d2cbd7a5d2547eba3d7a51b49672697eb949ec5c0

Observation ddd918c2-3de6-4f56-9bc8-1f16419d28cd · outbound

This paper cites and Jennings, N.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Jennings, N

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.269917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.321787Z digest=sha256:e660f39bdcd5b8d67852176bf2573ef3aeafb4ea0dc73ceff58668b9fde1045b

Observation 2c1f8ae7-6869-4559-94c5-4013f2ab54dd · outbound

This paper cites The Rise and Potential of Large Language Model Based Agents: A Survey.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning The Rise and Potential of Large Language Model Based Agents: A Survey

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.384612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.384612Z digest=sha256:ac8e6426fc0c8cc495e93f3880e815d85edaec9becda6f5974f5863903c9b03f

Observation c70ee563-a50c-4e93-979c-51288df6d0a9 · outbound

This paper cites Language agents with reinforcement learning for strategic play in the werewolf game.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Language agents with reinforcement learning for strategic play in the werewolf game

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:12.042081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.494820Z digest=sha256:e191bb205aa07b5e521e8badad74dc099464beae2c51a8a78e11a8574cd36c4e

Observation 0185b1c2-0b29-414c-b1c1-c5794eee1498 · outbound

This paper cites L., Cao, Y., and Narasimhan, K.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning L., Cao, Y., and Narasimhan, K

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.794886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.589788Z digest=sha256:55b89844e0113c7111c9243b19e6906b6b461ce50f5f4c70d28361069026a418

Observation 817ec64a-3d18-48ab-9631-d848d3332896 · outbound

This paper cites ReAct : Synergizing reasoning and acting in language models.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ReAct : Synergizing reasoning and acting in language models

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.610093Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.673939Z digest=sha256:58f64d191e10699dcdead1ee7eb45cf330122db215f4957c10f77f9a21193219

Observation fc3a4105-8d4c-4a4e-a273-14bf42a0acd4 · outbound

This paper cites and Zhang, X.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning and Zhang, X

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.419903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.777609Z digest=sha256:bd4484856e77af8c0b24cb02c4a5e25dc73fb9845bf6eb02aea1bf7ceff60e6c

Observation 48c2b5e5-ade5-4ae1-8b20-498d33b23bb1 · outbound

This paper cites AgentTuning: Enabling Generalized Agent Abilities for LLMs.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning AgentTuning: Enabling Generalized Agent Abilities for LLMs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:09.861270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:09.861270Z digest=sha256:0a44470167aa90db71d16e7490b8177202d7011170581deb334f19c8fa3362e5

Observation 6a976452-1826-4171-81c3-eabbf5704b52 · outbound

This paper cites Fine-tuning large vision-language models as decision-making agents via reinforcement learning.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning Fine-tuning large vision-language models as decision-making agents via reinforcement learning

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:11.152936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:09.941309Z digest=sha256:e859dbef83bd7c3c262ae14246825d07fc53275ce4dd7a9eb4068cd277a3cc1e

Observation fd947cf8-8c63-4b6d-ad67-9eac04d6b612 · outbound

This paper cites V., and Chi, E.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning V., and Chi, E

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:10.882812Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:10.079649Z digest=sha256:ff23fbfb8fcaa6e36790d57e3084a0e8c59df10e8b59e147ce101dfd7fc74834

Observation f01e7953-3233-4980-930d-fd6b86528269 · outbound

This paper cites ArCHer : Training language model agents via hierarchical multi-turn rl.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning ArCHer : Training language model agents via hierarchical multi-turn rl

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:10:10.645452Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T14:10:10.148144Z digest=sha256:fbb6a4d3cff79a7a38b20ec8272d68ea2f70ae37d21163714c9d1f226d219e44

Observation 957e7a45-d9e3-4f42-9ef8-5939a58610e6 · outbound

This paper cites write newline.

Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning write newline

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:10.212302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:10:10.212302Z digest=sha256:beb39ce44e75c2278be6625178c0d5d0e6fc2fc1a9db23e10f7510baf89e606d

Pith citing papers

Observation 78f0ead6-0e63-42c4-9531-88f652aca04e · inbound

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory cites this paper.

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 226

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T23:13:15.620491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-14T23:13:15.016486Z digest=sha256:b33ae2b8a996606a5f3217a027db1204a1d4e4e600c5218c0bd5bebe6120545c

Observation 9085988c-cfee-4f5c-9c20-28609aaea7a6 · inbound

Agentic Reasoning for Large Language Models cites this paper.

Agentic Reasoning for Large Language Models Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 131

Resolution
verified exact
arxiv_id, observed 2026-05-17T15:14:26.096893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-17T15:14:25.558878Z digest=sha256:17fd1ac1a0009e3dc1e7d63c5dfd9d05226ad8ee59559dddf3d127fc8a773b3b

Observation 3ee393cc-93e7-424b-a369-c7cbf8af333f · inbound

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents cites this paper.

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T18:36:28.440409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:35:45.900606Z digest=sha256:af82676c2cd7418a15e4dc7ebad4c3de126fc9ee53527fc12b34eece4489a023

Observation 68d5c6ab-a654-4ac0-becd-bec365c45249 · inbound

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading cites this paper.

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:26:05.986088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-09T17:08:46.405278Z digest=sha256:96bee2389296813431bf8d8436093fbd993035d82bef453651d8d95539846c68

Observation 14b9cd96-96f3-4b2a-864d-29f7400d0a09 · inbound

DeSQ: Decomposition-based SPARQL Query Generation cites this paper.

DeSQ: Decomposition-based SPARQL Query Generation Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning

Reference 57

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T19:36:09.118286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-28T22:15:13.878078Z digest=sha256:4fc1caea18b240c32ca1395f29b59596cee19dfa841b1ced4e97f94d3ae97b9e