Pith. sign in

Paper Citation Record · LEDGER

Enhancing Decision-Making of Large Language Models via Actor-Critic

As of 7 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2506.06376.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.06376 v1

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:55:44.534042Z

measured 64 of 64 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

64 of 64 outbound references displayed

  • verified exact2
  • verified fuzzy26
  • unresolved36
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8545f206-1b6b-4f21-a513-9e004cf2015a · outbound

This paper cites GPT-4 Technical Report.

Enhancing Decision-Making of Large Language Models via Actor-Critic GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.248408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.248408Z digest=sha256:0fe59101d4e9a93affd3465b61ec5d110428f599447c7fd0d56f1888749209ed

Observation 975e3704-223f-425f-a56b-12dfa3596532 · outbound

This paper cites G., Sutton, R.

Enhancing Decision-Making of Large Language Models via Actor-Critic G., Sutton, R

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.151052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.251820Z digest=sha256:9a01fcb6a0befc4a42b5b9a96ff68d0c2397a3b968ca184a77fad0ec96482408

Observation 2168a1e0-8dd4-455f-9f7b-18017c98c202 · outbound

This paper cites L., and Singh, S.

Enhancing Decision-Making of Large Language Models via Actor-Critic L., and Singh, S

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.142798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.255161Z digest=sha256:35268733db4e5c45e1398cf1a9c61597598ee647783bf1f5582fcd85fc17df5d

Observation b7f2a298-d835-4bd1-af34-06a57bb0be0e · outbound

This paper cites The computational complexity of propositional strips planning.

Enhancing Decision-Making of Large Language Models via Actor-Critic The computational complexity of propositional strips planning

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.133991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.258099Z digest=sha256:fcf50ad7a805f0796e45c98bc63717502a79a204c16da50d8b8b15d97fd02852

Observation dd9d9076-8045-41db-8410-883e6b4081fd · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Grounding large language models in interactive environments with online reinforcement learning

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.124847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.261230Z digest=sha256:e23bf87eb414c78091d536f50f117b53425a9cdcc01b65b31e107963a3aa28c8

Observation 59c50699-e384-45a9-acfe-58921f6706d3 · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning, 2023 b.

Enhancing Decision-Making of Large Language Models via Actor-Critic Grounding large language models in interactive environments with online reinforcement learning, 2023 b

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.115918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.264183Z digest=sha256:7d9ab066f00e691e6c276ec283e0791903b75a2e801769209d76aeaf3a920865

Observation 77a7d3de-3672-4db1-bbcd-0534a24b3157 · outbound

This paper cites Decision transformer: Reinforcement learning via sequence modeling.

Enhancing Decision-Making of Large Language Models via Actor-Critic Decision transformer: Reinforcement learning via sequence modeling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.267264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.267264Z digest=sha256:940e9b30b47a9763532b563d8d9330719d33e4f955dfbeadfeb3c6475072e880

Observation ebaae906-8f3d-45cc-b8ea-90587c083b3a · outbound

This paper cites BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.269879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.269879Z digest=sha256:3c35f6c47ae8b316eee603358bdd2ca1d03c420a8092a7314ee7a8228a777f82

Observation ab4c0389-bc79-472f-bb80-913288a16547 · outbound

This paper cites Efficient selectivity and backup operators in monte-carlo tree search.

Enhancing Decision-Making of Large Language Models via Actor-Critic Efficient selectivity and backup operators in monte-carlo tree search

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.101508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.272705Z digest=sha256:0d97de5588e44cee619b1d36e11e0fc2f64e3a4711f1e2ecb59af39f674d6246

Observation 273a0c2d-3aa1-46e3-917f-7a4d294b61ee · outbound

This paper cites The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks.

Enhancing Decision-Making of Large Language Models via Actor-Critic The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.275248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.275248Z digest=sha256:9647603e08554da56f1b937e8d99d9fd0e69fc8726941426575ae2c2ab40002e

Observation e6b75a92-a039-4a5c-b076-ea2abdecd9b8 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.278393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.278393Z digest=sha256:510bdd1274ebf2e6cc03070da8898a97ef5a31070b048052d6b58ef385847c3a

Observation 4bd6fbee-d000-4806-ac94-da470ee7782e · outbound

This paper cites Task and motion planning with large language models for object rearrangement.

Enhancing Decision-Making of Large Language Models via Actor-Critic Task and motion planning with large language models for object rearrangement

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.092899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.281136Z digest=sha256:bb789ee5bdeec92bf8c8e8ed0514c2c6d077442f338f132691412e59dbece99a

Observation 06fd3275-af0c-40da-9583-c506bf321a1f · outbound

This paper cites Low-rank modular reinforcement learning via muscle synergy.

Enhancing Decision-Making of Large Language Models via Actor-Critic Low-rank modular reinforcement learning via muscle synergy

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.083971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.283993Z digest=sha256:d572a9ff9d698729878d65d296c6e9eb54829cecbd8812b5d565ce7c13bcff9c

Observation fde0f198-05f3-43e7-8456-d66dcd5d460c · outbound

This paper cites PreAct: Prediction Enhances Agent's Planning Ability.

Enhancing Decision-Making of Large Language Models via Actor-Critic PreAct: Prediction Enhances Agent's Planning Ability

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:55:44.767850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.286512Z digest=sha256:1692e97d32f812ff33a37e86df5d9a28c9529b8620fd3d0953df053703884637

Observation 62c6fff1-2d4d-4c47-96ec-20ee9e47d33c · outbound

This paper cites Addressing function approximation error in actor-critic methods.

Enhancing Decision-Making of Large Language Models via Actor-Critic Addressing function approximation error in actor-critic methods

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.289495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.289495Z digest=sha256:7ff4403d0e4a1e723c7a70a63dc9699253f03309b212b868b8714be7eaa4ced9

Observation edc425d8-0a9b-413f-aa1c-6f753ce0daea · outbound

This paper cites Aligning language models with preferences through f -divergence minimization.

Enhancing Decision-Making of Large Language Models via Actor-Critic Aligning language models with preferences through f -divergence minimization

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.069984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.292179Z digest=sha256:df4a372d3bab4576d5d1b59e7fcdba55dc8f483a05631e27b33da6d56e059cd3

Observation 2ac67d04-99fa-490c-9ed6-559499e0f2bc · outbound

This paper cites Benchmarking the spectrum of agent capabilities.

Enhancing Decision-Making of Large Language Models via Actor-Critic Benchmarking the spectrum of agent capabilities

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.061015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.294660Z digest=sha256:e781d5b8be5c27020d6f9ae4761e6108df711d420a8800906adda73080d98838

Observation f79bef7e-05f9-42d3-b19d-2cb02e04ca24 · outbound

This paper cites Reasoning with language model is planning with world model.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reasoning with language model is planning with world model

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.297209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.297209Z digest=sha256:cd35008409bc916ee4e76d44222b9b442e1017002759a08cad438d63592ebc4f

Observation 9e9defb4-19ea-4433-b16f-14bfa5b8bebc · outbound

This paper cites J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W.

Enhancing Decision-Making of Large Language Models via Actor-Critic J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.300066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.300066Z digest=sha256:7581f9f9070c395d643618a8dde4376b3a76ca3e723a75b12913a5b90518fb6f

Observation 83373baa-7c68-4e5b-8faf-e54c545eef5d · outbound

This paper cites Towards Reasoning in Large Language Models: A Survey.

Enhancing Decision-Making of Large Language Models via Actor-Critic Towards Reasoning in Large Language Models: A Survey

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.302536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.302536Z digest=sha256:4cef6be261549048a70e6e2fdc3fac2aa1a6438c470ab91c4a26218e12d25cd4

Observation 48bf0bc7-2a31-4f5f-9ece-ee18bb0f71ae · outbound

This paper cites One policy to control them all: Shared modular policies for agent-agnostic control.

Enhancing Decision-Making of Large Language Models via Actor-Critic One policy to control them all: Shared modular policies for agent-agnostic control

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.046114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.305625Z digest=sha256:4abf56283c3dc4d5e8082e25ebb1c4f5caba33e2456e131ac597011367a83375

Observation c654ec8b-8bc6-4ae6-b158-f6bab095a8d6 · outbound

This paper cites Language models as zero-shot planners: Extracting actionable knowledge for embodied agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Language models as zero-shot planners: Extracting actionable knowledge for embodied agents

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.037344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.308201Z digest=sha256:3f5be27432398ccef1c518bd753e362a56eb4aa572be80622138d659c6d60f97

Observation 5b95ead7-6844-4ec6-9344-38c735df3674 · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.310610Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.310610Z digest=sha256:45afd87a9d8cae4cb4a4bd3e675a3e323b425c1a4ed2cdcd3debfe7b6406c1e9

Observation f85e32c8-2672-4350-b218-7b57feb692c0 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:45.028202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.313193Z digest=sha256:52d53a08540ecd4c26a23390639d1744022d9dc5b3b8ca4ae747ff69fe26da4c

Observation f5e38c5e-38e8-475c-a4eb-10f94397855f · outbound

This paper cites Learning trajectory preferences for manipulators via iterative improvement.

Enhancing Decision-Making of Large Language Models via Actor-Critic Learning trajectory preferences for manipulators via iterative improvement

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:45.019246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.315854Z digest=sha256:18631105dbf508d61f3a34c057ea87d4569085b2d6cc9d23de9e53eea167d74c

Observation e3497c31-e362-41c9-85e0-4957d8befcd4 · outbound

This paper cites Mistral 7B.

Enhancing Decision-Making of Large Language Models via Actor-Critic Mistral 7B

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.318509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.318509Z digest=sha256:43a0f14ddc28804f6d84243918bfb52ae12aadfd84eadc7735cd76384b96623a

Observation 35d14291-865b-47b3-bc22-8e4d096f8785 · outbound

This paper cites A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods.

Enhancing Decision-Making of Large Language Models via Actor-Critic A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.322888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.322888Z digest=sha256:4eee88679d8fcc1cb829760b947717353255dac25be0475bbf76b25826e6adb9

Observation ec19ea2e-4a17-4001-aefa-b0986b28b35a · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:45.010508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.325521Z digest=sha256:6788b2fc694bd9cc7bf5a636ee32b3e8c71eb615cd115a0a959650856a0a2c81

Observation e0343ef6-cb72-4f1d-ae60-525af75069d9 · outbound

This paper cites and Szepesv \'a ri, C.

Enhancing Decision-Making of Large Language Models via Actor-Critic and Szepesv \'a ri, C

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.328311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.328311Z digest=sha256:b3e0e192e7c48aac644bf07a2f5b6c70101459cce93f92d612b10a83f111db4c

Observation 7908c0e6-fd04-48d2-ad92-4408d6c67248 · outbound

This paper cites Y., McAleer, S., Fried, D., and Salakhutdinov, R.

Enhancing Decision-Making of Large Language Models via Actor-Critic Y., McAleer, S., Fried, D., and Salakhutdinov, R

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.331022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.331022Z digest=sha256:7da284f52a09ad7384f3ca12de0af62913580c98306d0cf4ba3a83d0f1d0a361

Observation a814a2f7-f3ec-4560-8c0a-c83797b52dba · outbound

This paper cites S., Reid, M., Matsuo, Y., and Iwasawa, Y.

Enhancing Decision-Making of Large Language Models via Actor-Critic S., Reid, M., Matsuo, Y., and Iwasawa, Y

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.333655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.333655Z digest=sha256:235222bbe3b2df6caf1190d2d614cee2d5b8164e7019ae10b148e94f49d01d9b

Observation 277a3b96-7b11-488d-a7dd-1ca7ca2b1ddf · outbound

This paper cites X., Nie, J.-Y., and Wen, J.-R.

Enhancing Decision-Making of Large Language Models via Actor-Critic X., Nie, J.-Y., and Wen, J.-R

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.336377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.336377Z digest=sha256:f32dc54e89c2c8c1fd207c2dcf6bce32af8aa3b00a200b0298830dd290227ce3

Observation 0e2da5ce-f74c-4a6f-a709-c5dff6fbc904 · outbound

This paper cites Unigen: A unified generative framework for retrieval and question answering with large language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unigen: A unified generative framework for retrieval and question answering with large language models

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.989911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.339233Z digest=sha256:a5dfa28b8cba32b6be502392f3e21db8f0342c08ec3e2b1474aa26a0403c859d

Observation b7fbf1c0-8cf3-49f5-911c-b7e59b01d496 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.980324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.341658Z digest=sha256:a2dbdce5280e5082f4c8614309bbc865bf1c642a81db6957efe3209c962a0114

Observation 01e787f9-0c88-42d5-a948-b9bf48de9b7d · outbound

This paper cites Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.457704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.457704Z digest=sha256:2ce73d11dc6fcb5e18b5f65e32200d3690d749cc5b240aa033e77de0571fa8f1

Observation 2f8d07c3-a60c-4d34-9168-bb15616861af · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.971943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.461051Z digest=sha256:4f1f86d2e805f61f608df823d8f9ac7bae553cc2eb4a792434a22baa70d07223

Observation 0ad159a1-a689-4cae-8e10-972e31afba8c · outbound

This paper cites Meta llama 3.

Enhancing Decision-Making of Large Language Models via Actor-Critic Meta llama 3

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.963613Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.463872Z digest=sha256:2880c5c47ae89489206e6d3973991f139d33d4f1f8e3a015d9d91fdc8e24bada

Observation ed997408-8027-44f6-a260-2ff357ba1bc8 · outbound

This paper cites Meta llama 3.1.

Enhancing Decision-Making of Large Language Models via Actor-Critic Meta llama 3.1

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.954996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.466393Z digest=sha256:74099179d49c3a6571ebf4c1f189bcb5cf6f7981a3585b76f7fa16e59d8aecdc

Observation bd9417d3-9dc8-451f-a888-91afc3a7b70b · outbound

This paper cites Augmented language models: a survey.

Enhancing Decision-Making of Large Language Models via Actor-Critic Augmented language models: a survey

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.946264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.469037Z digest=sha256:0c4ba6fb707e4842db6109fad167131a1d1a634d131c55018b3a809d9415e78e

Observation 163cc2d4-c4e2-49bd-93c3-61050bed5f00 · outbound

This paper cites BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games.

Enhancing Decision-Making of Large Language Models via Actor-Critic BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.471737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.471737Z digest=sha256:4692e3102dffdee8d8e8a49cb1ff3539ae4b96a8d9ec9d4ec231c78f4fd6f2cd

Observation 4a91ba41-5412-4b3a-ba82-1d372584acd4 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.474500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.474500Z digest=sha256:693d1f7c32b1ce0b0e4f02c4fe803efeccae4c6db5498154c31fe880d529668f

Observation 319de725-a390-4093-921c-24f013875939 · outbound

This paper cites and Schaal, S.

Enhancing Decision-Making of Large Language Models via Actor-Critic and Schaal, S

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.477102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.477102Z digest=sha256:fe0146fca5cfc5259a9e220c01005d05b601f1363a883537b9560235a22ac962

Observation c34eb28c-b6bf-4581-9945-4535d81cb2d0 · outbound

This paper cites Why think step by step? reasoning emerges from the locality of experience.

Enhancing Decision-Making of Large Language Models via Actor-Critic Why think step by step? reasoning emerges from the locality of experience

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.932022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.479697Z digest=sha256:5cdb117212aa6b1dd0731c5e34212aff4784f1d7b9ec353b295b69d3a3d7ae0b

Observation 01743166-a593-4771-a463-4a15f7212bfb · outbound

This paper cites D., Ermon, S., and Finn, C.

Enhancing Decision-Making of Large Language Models via Actor-Critic D., Ermon, S., and Finn, C

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.482320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.482320Z digest=sha256:e50307039a0ea5ecacd3babe5cb5ae93b80b953d3cc494d0eb629a3e90449fdc

Observation ea598e5b-acc9-4028-9028-af4d1cf71160 · outbound

This paper cites Code Llama: Open Foundation Models for Code.

Enhancing Decision-Making of Large Language Models via Actor-Critic Code Llama: Open Foundation Models for Code

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.484816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.484816Z digest=sha256:128f323782ff4e3bb45b3d1f1aa3ffa475a20e424c07479f490c74c29653d8e1

Observation 8e6f3dd8-db1b-4ce5-a1d0-25429639149e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Enhancing Decision-Making of Large Language Models via Actor-Critic Proximal Policy Optimization Algorithms

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.487555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.487555Z digest=sha256:62b29a64ce1768638bafefc3598e699df97ea748866b8b082d2aa9b8a6bb56a8

Observation e4682510-9830-4f2a-a729-038bd34ddb05 · outbound

This paper cites Reflexion: Language agents with verbal reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic Reflexion: Language agents with verbal reinforcement learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.490111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.490111Z digest=sha256:a941a1940ccd1a48c4693c4d52b5f180e363021b048dab4d5a0e1db23079dac5

Observation 11b55e9a-8dea-4083-838c-dd7cd39ad867 · outbound

This paper cites Alfred: A benchmark for interpreting grounded instructions for everyday tasks.

Enhancing Decision-Making of Large Language Models via Actor-Critic Alfred: A benchmark for interpreting grounded instructions for everyday tasks

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.912098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.492701Z digest=sha256:0696f589ae5179b542db32742d5e5a21cf00b852742cc489d8679e516788db02

Observation e74a8459-b34b-490b-9a65-a0024ebd13d6 · outbound

This paper cites Alfworld: Aligning text and embodied environments for interactive learning, 2021.

Enhancing Decision-Making of Large Language Models via Actor-Critic Alfworld: Aligning text and embodied environments for interactive learning, 2021

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.903299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.495003Z digest=sha256:4cc72b2b8317da0bdaf48b177e2e3d91e4e3dc68d756b3d70e434dfa6cdf5ad8

Observation 56c293c6-26b3-47ea-9086-c8aed55075a0 · outbound

This paper cites Progprompt: Generating situated robot task plans using large language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Progprompt: Generating situated robot task plans using large language models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.497377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.497377Z digest=sha256:ed7d8b84f505a5131d7fdb6d57c52024fe4b7bc678628e030994964a7079b35f

Observation 17417333-0912-4f74-9e50-becfb8978e61 · outbound

This paper cites D., and Toshev, A.

Enhancing Decision-Making of Large Language Models via Actor-Critic D., and Toshev, A

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.888314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.500183Z digest=sha256:167844afc42d1dc3ae8b773b08dc502579dfbe1cd34dbbfa44fa2de5f811ded5

Observation 61495bfc-42c5-491c-80ea-76d0aeb7f3f2 · outbound

This paper cites True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning.

Enhancing Decision-Making of Large Language Models via Actor-Critic True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.879712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.502726Z digest=sha256:512a4a190822f2a01996c9bd75db3a2169bfd62ebf25b2ff8d8c4699858da705

Observation ac4d6994-e8ea-49eb-8f2b-cbe00d981b26 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Enhancing Decision-Making of Large Language Models via Actor-Critic Gemma: Open Models Based on Gemini Research and Technology

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.505310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.505310Z digest=sha256:86f5014da7c5f076d7818ac33e8de6f9915e75cd20e512b9137ccde99ee93d8f

Observation b02096e9-2c90-4cbc-b0a8-ea3568ddbafb · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.508021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.508021Z digest=sha256:023103cee9440a91648cfa5b1d93ae4339ba3bbecda90116533aec7b6da6dad2

Observation d73eeb31-a55b-4e02-8247-df8e1f2f7128 · outbound

This paper cites an unresolved cited work.

Enhancing Decision-Making of Large Language Models via Actor-Critic Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:55:44.870756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.510775Z digest=sha256:1482845417846118f87938cd898a60c48e4ddf6157fcaf537e74ab30cb02398c

Observation c25f6ddd-dc09-48d4-9350-8e3d25bdb74e · outbound

This paper cites V., Zhou, D., et al.

Enhancing Decision-Making of Large Language Models via Actor-Critic V., Zhou, D., et al

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.513182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.513182Z digest=sha256:e559b90cb4bec32b5de6c93c61290726830cfef9f612e78d854e2c6ac07b5bc2

Observation c8d8e698-062d-48b7-88b1-95778729ebe5 · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.515658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.515658Z digest=sha256:b83d1a42ca0c2661c569e8f4469f2eb4d47e7901257da90a143c47d099183668

Observation 42b7e1e6-0945-4541-b622-0bf63df593cc · outbound

This paper cites React: Synergizing reasoning and acting in language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic React: Synergizing reasoning and acting in language models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.518179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.518179Z digest=sha256:0c6b71909f10eaa14b90427ccae5366b3c28e8cc78f7677eb300705c7fe91d3f

Observation 64947bb9-e6d6-4e8f-923c-7162fe407f26 · outbound

This paper cites C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al.

Enhancing Decision-Making of Large Language Models via Actor-Critic C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.844499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.520944Z digest=sha256:62d6f86762ff8ae515121423921725a9a7edf8a189e78c3cce424a83f2893fa8

Observation 472a3cc8-de4a-4b05-8766-b80fb2efa25a · outbound

This paper cites Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach.

Enhancing Decision-Making of Large Language Models via Actor-Critic Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach

Reference 60

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:55:44.581052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.523696Z digest=sha256:bda3700e45fab288bfcea11b28700f9d02c24c30af07e29825b54ee5cc217462

Observation b77abfaa-bc0b-4880-bf6b-be5f5fbb1df1 · outbound

This paper cites Large language models are semi-parametric reinforcement learning agents.

Enhancing Decision-Making of Large Language Models via Actor-Critic Large language models are semi-parametric reinforcement learning agents

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.835461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.526453Z digest=sha256:8573318c5abb179b1e31827f2ade43fd6ee10ee44cb804336be5c63292e93a20

Observation b27d00e7-f66f-454a-b8f4-507347a539f5 · outbound

This paper cites Language agent tree search unifies reasoning, acting, and planning in language models.

Enhancing Decision-Making of Large Language Models via Actor-Critic Language agent tree search unifies reasoning, acting, and planning in language models

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.827040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.529045Z digest=sha256:32f3f9b29d6add4c9d5c3a67126c810f210ba32dccd7fbb28b423fbe6e499ccc

Observation 1d16ed95-0271-4c05-b3a7-166c87a4cd8f · outbound

This paper cites Archer: Training language model agents via hierarchical multi-turn rl.

Enhancing Decision-Making of Large Language Models via Actor-Critic Archer: Training language model agents via hierarchical multi-turn rl

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:55:44.818408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-08-07T10:55:44.531578Z digest=sha256:21da6f4d303d17c2cea854380b1bd60077e00241a25d58110135ae28668544f2

Observation f1c2c3a5-e6c6-4360-8658-418e81908b5b · outbound

This paper cites write newline.

Enhancing Decision-Making of Large Language Models via Actor-Critic write newline

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T10:55:44.534042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:55:44.534042Z digest=sha256:842779b423ed6670467ecb20870a4edd9029bc500ece9aa27024b38eb65f56eb

Pith citing papers

No inbound Pith citation observations are available.