{"as_of":"2026-08-08T02:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66d5c66db704d3f10e812774edd8e4a93e349373e335126e3c3d97dedfc06fcf","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:44.534042Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06376/citation-record","integrity":"/paper/2506.06376/integrity","json":"/paper/2506.06376/citation-record.json","paper":"/paper/2506.06376"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:55:44.248408Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.248408Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:0fe59101d4e9a93affd3465b61ec5d110428f599447c7fd0d56f1888749209ed","observation_id":"8545f206-1b6b-4f21-a513-9e004cf2015a","resolution":{"observed_at":"2026-08-07T10:55:44.248408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.148420Z","title":"G., Sutton, R","venue":null,"work_id":"ac3eeaa8-5c9d-4179-9486-3ed91cbe7cad","year":1989},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.251820Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:9a01fcb6a0befc4a42b5b9a96ff68d0c2397a3b968ca184a77fad0ec96482408","observation_id":"975e3704-223f-425f-a56b-12dfa3596532","resolution":{"observed_at":"2026-08-07T10:55:45.151052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.139959Z","title":"L., and Singh, S","venue":null,"work_id":"507f22d2-bc64-40d8-894d-492cb28aa4e9","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.255161Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:35268733db4e5c45e1398cf1a9c61597598ee647783bf1f5582fcd85fc17df5d","observation_id":"2168a1e0-8dd4-455f-9f7b-18017c98c202","resolution":{"observed_at":"2026-08-07T10:55:45.142798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.130773Z","title":"The computational complexity of propositional strips planning","venue":null,"work_id":"168f13a7-4e0e-499d-ad66-a35d96550594","year":1994},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.258099Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:fcf50ad7a805f0796e45c98bc63717502a79a204c16da50d8b8b15d97fd02852","observation_id":"b7f2a298-d835-4bd1-af34-06a57bb0be0e","resolution":{"observed_at":"2026-08-07T10:55:45.133991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.121770Z","title":"Grounding large language models in interactive environments with online reinforcement learning","venue":null,"work_id":"593dc9f9-f735-49aa-ba1d-5b0c764db4e3","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.261230Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:e23bf87eb414c78091d536f50f117b53425a9cdcc01b65b31e107963a3aa28c8","observation_id":"dd9d9076-8045-41db-8410-883e6b4081fd","resolution":{"observed_at":"2026-08-07T10:55:45.124847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.112950Z","title":"Grounding large language models in interactive environments with online reinforcement learning, 2023 b","venue":null,"work_id":"f318f237-5f72-4292-8e70-866faa42636e","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.264183Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:7d9ab066f00e691e6c276ec283e0791903b75a2e801769209d76aeaf3a920865","observation_id":"59c50699-e384-45a9-acfe-58921f6706d3","resolution":{"observed_at":"2026-08-07T10:55:45.115918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.267264Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.267264Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:940e9b30b47a9763532b563d8d9330719d33e4f955dfbeadfeb3c6475072e880","observation_id":"77a7d3de-3672-4db1-bbcd-0534a24b3157","resolution":{"observed_at":"2026-08-07T10:55:44.267264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-07-06T07:09:15.174187Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-08-07T10:55:44.269879Z","title":"H., and Bengio, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.269879Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:3c35f6c47ae8b316eee603358bdd2ca1d03c420a8092a7314ee7a8228a777f82","observation_id":"ebaae906-8f3d-45cc-b8ea-90587c083b3a","resolution":{"observed_at":"2026-08-07T10:55:44.269879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.098587Z","title":"Efficient selectivity and backup operators in monte-carlo tree search","venue":null,"work_id":"4f591ba0-ae5f-476a-856f-592648914224","year":2006},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.272705Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:0d97de5588e44cee619b1d36e11e0fc2f64e3a4711f1e2ecb59af39f674d6246","observation_id":"ab4c0389-bc79-472f-bb80-913288a16547","resolution":{"observed_at":"2026-08-07T10:55:45.101508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08235","last_updated":"2025-02-12T09:23:26Z","snapshot_observed_at":"2026-07-06T20:35:16.369243Z","submitted_at":"2025-02-12T09:23:26Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08235","snapshot_observed_at":"2026-08-07T10:55:44.275248Z","title":"G., Xia, T., Mao, H., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.275248Z"},"links":{"cited_paper":"/paper/2502.08235","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:9647603e08554da56f1b937e8d99d9fd0e69fc8726941426575ae2c2ab40002e","observation_id":"273a0c2d-3aa1-46e3-917f-7a4d294b61ee","resolution":{"observed_at":"2026-08-07T10:55:44.275248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:55:44.278393Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.278393Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:510bdd1274ebf2e6cc03070da8898a97ef5a31070b048052d6b58ef385847c3a","observation_id":"e6b75a92-a039-4a5c-b076-ea2abdecd9b8","resolution":{"observed_at":"2026-08-07T10:55:44.278393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.089747Z","title":"Task and motion planning with large language models for object rearrangement","venue":null,"work_id":"3b8124ec-51e0-4c65-abbc-65dd22df9618","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.281136Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:bb789ee5bdeec92bf8c8e8ed0514c2c6d077442f338f132691412e59dbece99a","observation_id":"4bd6fbee-d000-4806-ac94-da470ee7782e","resolution":{"observed_at":"2026-08-07T10:55:45.092899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.081101Z","title":"Low-rank modular reinforcement learning via muscle synergy","venue":null,"work_id":"70871171-3882-45de-9c6c-a8166dc1612b","year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.283993Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:d572a9ff9d698729878d65d296c6e9eb54829cecbd8812b5d565ce7c13bcff9c","observation_id":"06fd3275-af0c-40da-9583-c506bf321a1f","resolution":{"observed_at":"2026-08-07T10:55:45.083971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11534","last_updated":"2024-12-05T04:40:54Z","snapshot_observed_at":"2026-08-06T11:30:50.211440Z","submitted_at":"2024-02-18T10:15:38Z","title":"PreAct: Prediction Enhances Agent's Planning Ability","version":2},"cited_work":{"arxiv_id":"2402.11534","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11534","snapshot_observed_at":"2026-08-07T10:55:44.764484Z","title":"PreAct: Prediction Enhances Agent's Planning Ability","venue":"cs.CL","work_id":"78bcb03e-e6ba-4beb-9c10-f0e3e95914ab","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.286512Z"},"links":{"cited_paper":"/paper/2402.11534","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:1692e97d32f812ff33a37e86df5d9a28c9529b8620fd3d0953df053703884637","observation_id":"fde0f198-05f3-43e7-8456-d66dcd5d460c","resolution":{"observed_at":"2026-08-07T10:55:44.767850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.289495Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.289495Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:7ff4403d0e4a1e723c7a70a63dc9699253f03309b212b868b8714be7eaa4ced9","observation_id":"62c6fff1-2d4d-4c47-96ec-20ee9e47d33c","resolution":{"observed_at":"2026-08-07T10:55:44.289495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.066598Z","title":"Aligning language models with preferences through f -divergence minimization","venue":null,"work_id":"6de0853f-631d-44b5-b983-8dd756051490","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.292179Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:df4a372d3bab4576d5d1b59e7fcdba55dc8f483a05631e27b33da6d56e059cd3","observation_id":"edc425d8-0a9b-413f-aa1c-6f753ce0daea","resolution":{"observed_at":"2026-08-07T10:55:45.069984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.058102Z","title":"Benchmarking the spectrum of agent capabilities","venue":null,"work_id":"45e07c5c-e8d8-4993-91ac-5442abfba495","year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.294660Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:e781d5b8be5c27020d6f9ae4761e6108df711d420a8800906adda73080d98838","observation_id":"2ac67d04-99fa-490c-9ed6-559499e0f2bc","resolution":{"observed_at":"2026-08-07T10:55:45.061015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.297209Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.297209Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:cd35008409bc916ee4e76d44222b9b442e1017002759a08cad438d63592ebc4f","observation_id":"f79bef7e-05f9-42d3-b19d-2cb02e04ca24","resolution":{"observed_at":"2026-08-07T10:55:44.297209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.300066Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.300066Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:7581f9f9070c395d643618a8dde4376b3a76ca3e723a75b12913a5b90518fb6f","observation_id":"9e9defb4-19ea-4433-b16f-14bfa5b8bebc","resolution":{"observed_at":"2026-08-07T10:55:44.300066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-08-07T10:55:44.302536Z","title":"and Chang, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.302536Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4cef6be261549048a70e6e2fdc3fac2aa1a6438c470ab91c4a26218e12d25cd4","observation_id":"83373baa-7c68-4e5b-8faf-e54c545eef5d","resolution":{"observed_at":"2026-08-07T10:55:44.302536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.043099Z","title":"One policy to control them all: Shared modular policies for agent-agnostic control","venue":null,"work_id":"88d8ea76-545b-4a8b-9746-255e5a6dd013","year":2020},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.305625Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4abf56283c3dc4d5e8082e25ebb1c4f5caba33e2456e131ac597011367a83375","observation_id":"48bf0bc7-2a31-4f5f-9ece-ee18bb0f71ae","resolution":{"observed_at":"2026-08-07T10:55:45.046114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.034154Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":"aa3545bc-0ce8-4416-ae82-a6376c340768","year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.308201Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:3f5be27432398ccef1c518bd753e362a56eb4aa572be80622138d659c6d60f97","observation_id":"c654ec8b-8bc6-4ae6-b158-f6bab095a8d6","resolution":{"observed_at":"2026-08-07T10:55:45.037344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T10:55:44.310610Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.310610Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:45afd87a9d8cae4cb4a4bd3e675a3e323b425c1a4ed2cdcd3debfe7b6406c1e9","observation_id":"5b95ead7-6844-4ec6-9344-38c735df3674","resolution":{"observed_at":"2026-08-07T10:55:44.310610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.025474Z","title":null,"venue":null,"work_id":"3d181765-56c3-467c-abda-89b3af8a055e","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.313193Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:52d53a08540ecd4c26a23390639d1744022d9dc5b3b8ca4ae747ff69fe26da4c","observation_id":"f85e32c8-2672-4350-b218-7b57feb692c0","resolution":{"observed_at":"2026-08-07T10:55:45.028202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.016361Z","title":"Learning trajectory preferences for manipulators via iterative improvement","venue":null,"work_id":"9cc9519f-ac73-4f38-bebc-c129eb4d860e","year":2013},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.315854Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:18631105dbf508d61f3a34c057ea87d4569085b2d6cc9d23de9e53eea167d74c","observation_id":"f5e38c5e-38e8-475c-a4eb-10f94397855f","resolution":{"observed_at":"2026-08-07T10:55:45.019246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T10:55:44.318509Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.318509Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:43a0f14ddc28804f6d84243918bfb52ae12aadfd84eadc7735cd76384b96623a","observation_id":"e3497c31-e362-41c9-85e0-4957d8befcd4","resolution":{"observed_at":"2026-08-07T10:55:44.318509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.322888Z","title":"A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.322888Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4eee88679d8fcc1cb829760b947717353255dac25be0475bbf76b25826e6adb9","observation_id":"35d14291-865b-47b3-bc22-8e4d096f8785","resolution":{"observed_at":"2026-08-07T10:55:44.322888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.007658Z","title":null,"venue":null,"work_id":"2a15495c-8cc6-4e37-ae72-75ab58485613","year":1995},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.325521Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:6788b2fc694bd9cc7bf5a636ee32b3e8c71eb615cd115a0a959650856a0a2c81","observation_id":"ec19ea2e-4a17-4001-aefa-b0986b28b35a","resolution":{"observed_at":"2026-08-07T10:55:45.010508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.328311Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.328311Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:b3e0e192e7c48aac644bf07a2f5b6c70101459cce93f92d612b10a83f111db4c","observation_id":"e0343ef6-cb72-4f1d-ae60-525af75069d9","resolution":{"observed_at":"2026-08-07T10:55:44.328311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.331022Z","title":"Y., McAleer, S., Fried, D., and Salakhutdinov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.331022Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:7da284f52a09ad7384f3ca12de0af62913580c98306d0cf4ba3a83d0f1d0a361","observation_id":"7908c0e6-fd04-48d2-ad92-4408d6c67248","resolution":{"observed_at":"2026-08-07T10:55:44.331022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.333655Z","title":"S., Reid, M., Matsuo, Y., and Iwasawa, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.333655Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:235222bbe3b2df6caf1190d2d614cee2d5b8164e7019ae10b148e94f49d01d9b","observation_id":"a814a2f7-f3ec-4560-8c0a-c83797b52dba","resolution":{"observed_at":"2026-08-07T10:55:44.333655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.336377Z","title":"X., Nie, J.-Y., and Wen, J.-R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.336377Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:f32dc54e89c2c8c1fd207c2dcf6bce32af8aa3b00a200b0298830dd290227ce3","observation_id":"277a3b96-7b11-488d-a7dd-1ca7ca2b1ddf","resolution":{"observed_at":"2026-08-07T10:55:44.336377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.986733Z","title":"Unigen: A unified generative framework for retrieval and question answering with large language models","venue":null,"work_id":"7546b036-3e31-4729-a62c-7004640916d5","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.339233Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:a5dfa28b8cba32b6be502392f3e21db8f0342c08ec3e2b1474aa26a0403c859d","observation_id":"0e2da5ce-f74c-4a6f-a709-c5dff6fbc904","resolution":{"observed_at":"2026-08-07T10:55:44.989911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.977497Z","title":null,"venue":null,"work_id":"de93201d-fbee-42fb-97e6-45fddb07c3dc","year":1996},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.341658Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:a2dbdce5280e5082f4c8614309bbc865bf1c642a81db6957efe3209c962a0114","observation_id":"b7fbf1c0-8cf3-49f5-911c-b7e59b01d496","resolution":{"observed_at":"2026-08-07T10:55:44.980324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17382","last_updated":"2024-06-24T05:25:21Z","snapshot_observed_at":"2026-08-03T23:03:20.128765Z","submitted_at":"2023-09-29T16:36:39Z","title":"Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17382","snapshot_observed_at":"2026-08-07T10:55:44.457704Z","title":"Reason for future, act for now: A principled framework for autonomous llm agents with provable sample efficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.457704Z"},"links":{"cited_paper":"/paper/2309.17382","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:2ce73d11dc6fcb5e18b5f65e32200d3690d749cc5b240aa033e77de0571fa8f1","observation_id":"01e787f9-0c88-42d5-a948-b9bf48de9b7d","resolution":{"observed_at":"2026-08-07T10:55:44.457704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.969068Z","title":null,"venue":null,"work_id":"475c1d06-87a4-4186-bf91-3013e1b7343f","year":1963},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.461051Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4f1f86d2e805f61f608df823d8f9ac7bae553cc2eb4a792434a22baa70d07223","observation_id":"2f8d07c3-a60c-4d34-9168-bb15616861af","resolution":{"observed_at":"2026-08-07T10:55:44.971943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.960868Z","title":"Meta llama 3","venue":null,"work_id":"22028402-bb38-4b18-814e-46d5cdeae605","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.463872Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:2880c5c47ae89489206e6d3973991f139d33d4f1f8e3a015d9d91fdc8e24bada","observation_id":"0ad159a1-a689-4cae-8e10-972e31afba8c","resolution":{"observed_at":"2026-08-07T10:55:44.963613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.952209Z","title":"Meta llama 3.1","venue":null,"work_id":"c553e79a-27f6-4356-86b4-f528724b2db3","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.466393Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:74099179d49c3a6571ebf4c1f189bcb5cf6f7981a3585b76f7fa16e59d8aecdc","observation_id":"ed997408-8027-44f6-a260-2ff357ba1bc8","resolution":{"observed_at":"2026-08-07T10:55:44.954996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.943396Z","title":"Augmented language models: a survey","venue":null,"work_id":"b51cb6a0-d2f2-4f3a-a2c1-0506206464b6","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.469037Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:0c4ba6fb707e4842db6109fad167131a1d1a634d131c55018b3a809d9415e78e","observation_id":"bd9417d3-9dc8-451f-a888-91afc3a7b70b","resolution":{"observed_at":"2026-08-07T10:55:44.946264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13543","last_updated":"2025-04-01T14:45:22Z","snapshot_observed_at":"2026-08-07T21:22:03.988482Z","submitted_at":"2024-11-20T18:54:32Z","title":"BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13543","snapshot_observed_at":"2026-08-07T10:55:44.471737Z","title":"N., Parker-Holder, J., and Rockt \\\"a schel, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.471737Z"},"links":{"cited_paper":"/paper/2411.13543","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4692e3102dffdee8d8e8a49cb1ff3539ae4b96a8d9ec9d4ec231c78f4fd6f2cd","observation_id":"163cc2d4-c4e2-49bd-93c3-61050bed5f00","resolution":{"observed_at":"2026-08-07T10:55:44.471737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T10:55:44.474500Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.474500Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:693d1f7c32b1ce0b0e4f02c4fe803efeccae4c6db5498154c31fe880d529668f","observation_id":"4a91ba41-5412-4b3a-ba82-1d372584acd4","resolution":{"observed_at":"2026-08-07T10:55:44.474500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.477102Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.477102Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:fe0146fca5cfc5259a9e220c01005d05b601f1363a883537b9560235a22ac962","observation_id":"319de725-a390-4093-921c-24f013875939","resolution":{"observed_at":"2026-08-07T10:55:44.477102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.929094Z","title":"Why think step by step? reasoning emerges from the locality of experience","venue":null,"work_id":"321dac53-18de-428d-aab7-27e11c983869","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.479697Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:5cdb117212aa6b1dd0731c5e34212aff4784f1d7b9ec353b295b69d3a3d7ae0b","observation_id":"c34eb28c-b6bf-4581-9945-4535d81cb2d0","resolution":{"observed_at":"2026-08-07T10:55:44.932022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.482320Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.482320Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:e50307039a0ea5ecacd3babe5cb5ae93b80b953d3cc494d0eb629a3e90449fdc","observation_id":"01743166-a593-4771-a463-4a15f7212bfb","resolution":{"observed_at":"2026-08-07T10:55:44.482320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T10:55:44.484816Z","title":"E., Adi, Y., Liu, J., Remez, T., Rapin, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.484816Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:128f323782ff4e3bb45b3d1f1aa3ffa475a20e424c07479f490c74c29653d8e1","observation_id":"ea598e5b-acc9-4028-9028-af4d1cf71160","resolution":{"observed_at":"2026-08-07T10:55:44.484816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:55:44.487555Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.487555Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:62b29a64ce1768638bafefc3598e699df97ea748866b8b082d2aa9b8a6bb56a8","observation_id":"8e6f3dd8-db1b-4ce5-a1d0-25429639149e","resolution":{"observed_at":"2026-08-07T10:55:44.487555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.490111Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.490111Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:a941a1940ccd1a48c4693c4d52b5f180e363021b048dab4d5a0e1db23079dac5","observation_id":"e4682510-9830-4f2a-a729-038bd34ddb05","resolution":{"observed_at":"2026-08-07T10:55:44.490111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.909140Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"92fbbb2d-a090-403e-9b50-f4d2d4ac4d3c","year":2020},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.492701Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:0696f589ae5179b542db32742d5e5a21cf00b852742cc489d8679e516788db02","observation_id":"11b55e9a-8dea-4083-838c-dd7cd39ad867","resolution":{"observed_at":"2026-08-07T10:55:44.912098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.900256Z","title":"Alfworld: Aligning text and embodied environments for interactive learning, 2021","venue":null,"work_id":"eb6c0a50-55dd-453b-893a-350935f1e9f3","year":2021},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.495003Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4cc72b2b8317da0bdaf48b177e2e3d91e4e3dc68d756b3d70e434dfa6cdf5ad8","observation_id":"e74a8459-b34b-490b-9a65-a0024ebd13d6","resolution":{"observed_at":"2026-08-07T10:55:44.903299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.497377Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.497377Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:ed7d8b84f505a5131d7fdb6d57c52024fe4b7bc678628e030994964a7079b35f","observation_id":"56c293c6-26b3-47ea-9086-c8aed55075a0","resolution":{"observed_at":"2026-08-07T10:55:44.497377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.885391Z","title":"D., and Toshev, A","venue":null,"work_id":"0148d944-708f-4497-86b6-0dfc4eaddbfd","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.500183Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:167844afc42d1dc3ae8b773b08dc502579dfbe1cd34dbbfa44fa2de5f811ded5","observation_id":"17417333-0912-4f74-9e50-becfb8978e61","resolution":{"observed_at":"2026-08-07T10:55:44.888314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.876477Z","title":"True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning","venue":null,"work_id":"1f684480-0e2c-469a-b379-4b84596728e7","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.502726Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:512a4a190822f2a01996c9bd75db3a2169bfd62ebf25b2ff8d8c4699858da705","observation_id":"61495bfc-42c5-491c-80ea-76d0aeb7f3f2","resolution":{"observed_at":"2026-08-07T10:55:44.879712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T10:55:44.505310Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.505310Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:86f5014da7c5f076d7818ac33e8de6f9915e75cd20e512b9137ccde99ee93d8f","observation_id":"ac4d6994-e8ea-49eb-8f2b-cbe00d981b26","resolution":{"observed_at":"2026-08-07T10:55:44.505310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:55:44.508021Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.508021Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:023103cee9440a91648cfa5b1d93ae4339ba3bbecda90116533aec7b6da6dad2","observation_id":"b02096e9-2c90-4cbc-b0a8-ea3568ddbafb","resolution":{"observed_at":"2026-08-07T10:55:44.508021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.867835Z","title":null,"venue":null,"work_id":"294bf7ab-5ef5-4ff8-adac-453e4de53236","year":1992},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.510775Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:1482845417846118f87938cd898a60c48e4ddf6157fcaf537e74ab30cb02398c","observation_id":"d73eeb31-a55b-4e02-8247-df8e1f2f7128","resolution":{"observed_at":"2026-08-07T10:55:44.870756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.513182Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.513182Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:e559b90cb4bec32b5de6c93c61290726830cfef9f612e78d854e2c6ac07b5bc2","observation_id":"c25f6ddd-dc09-48d4-9350-8e3d25bdb74e","resolution":{"observed_at":"2026-08-07T10:55:44.513182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.515658Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.515658Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:b83d1a42ca0c2661c569e8f4469f2eb4d47e7901257da90a143c47d099183668","observation_id":"c8d8e698-062d-48b7-88b1-95778729ebe5","resolution":{"observed_at":"2026-08-07T10:55:44.515658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.518179Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.518179Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:0c6b71909f10eaa14b90427ccae5366b3c28e8cc78f7677eb300705c7fe91d3f","observation_id":"42b7e1e6-0945-4541-b622-0bf63df593cc","resolution":{"observed_at":"2026-08-07T10:55:44.518179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.841600Z","title":"C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al","venue":null,"work_id":"01837093-d9df-46dc-8e04-79ee688abbb9","year":null},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.520944Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:62d6f86762ff8ae515121423921725a9a7edf8a189e78c3cce424a83f2893fa8","observation_id":"64947bb9-e6d6-4e8f-923c-7162fe407f26","resolution":{"observed_at":"2026-08-07T10:55:44.844499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13884","last_updated":"2024-01-23T14:11:04Z","snapshot_observed_at":"2026-07-06T16:51:27.372220Z","submitted_at":"2023-11-23T10:14:58Z","title":"Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach","version":3},"cited_work":{"arxiv_id":"2311.13884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13884","snapshot_observed_at":"2026-08-07T10:55:44.576047Z","title":"Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach","venue":"cs.AI","work_id":"9e02567f-7301-447a-b352-6fb6924f6ef0","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.523696Z"},"links":{"cited_paper":"/paper/2311.13884","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:bda3700e45fab288bfcea11b28700f9d02c24c30af07e29825b54ee5cc217462","observation_id":"472a3cc8-de4a-4b05-8766-b80fb2efa25a","resolution":{"observed_at":"2026-08-07T10:55:44.581052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.832670Z","title":"Large language models are semi-parametric reinforcement learning agents","venue":null,"work_id":"acfe49e2-47eb-4aca-aec9-b3d81fbbc560","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.526453Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:8573318c5abb179b1e31827f2ade43fd6ee10ee44cb804336be5c63292e93a20","observation_id":"b77abfaa-bc0b-4880-bf6b-be5f5fbb1df1","resolution":{"observed_at":"2026-08-07T10:55:44.835461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.824094Z","title":"Language agent tree search unifies reasoning, acting, and planning in language models","venue":null,"work_id":"fd5823ff-ecbe-419e-baf8-1d592868168a","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.529045Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:32f3f9b29d6add4c9d5c3a67126c810f210ba32dccd7fbb28b423fbe6e499ccc","observation_id":"b27d00e7-f66f-454a-b8f4-507347a539f5","resolution":{"observed_at":"2026-08-07T10:55:44.827040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.815217Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"f51b9777-adf3-4046-995c-84d2813b7bf2","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.531578Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:21da6f4d303d17c2cea854380b1bd60077e00241a25d58110135ae28668544f2","observation_id":"1d16ed95-0271-4c05-b3a7-166c87a4cd8f","resolution":{"observed_at":"2026-08-07T10:55:44.818408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.534042Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.534042Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:842779b423ed6670467ecb20870a4edd9029bc500ece9aa27024b38eb65f56eb","observation_id":"f1c2c3a5-e6c6-4360-8658-418e81908b5b","resolution":{"observed_at":"2026-08-07T10:55:44.534042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:22:45.066183Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2506.06376."}