{"as_of":"2026-08-10T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0404e64465421831dbe55573474c60b8926943d91833073468a3f66a2712fb34","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T01:09:03.186224Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:32:30.453762Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:57:41.552773Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18009","snapshot_observed_at":"2026-08-06T04:32:30.453762Z","title":"Large language models think too fast to explore effectively","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03444","last_updated":"2025-08-05T13:41:32Z","snapshot_observed_at":"2026-08-06T04:32:14.099496Z","submitted_at":"2025-08-05T13:41:32Z","title":"An Auditable Agent Platform For Automated Molecular Optimisation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T04:32:30.453762Z"},"links":{"cited_paper":"/paper/2501.18009","citing_paper":"/paper/2508.03444"},"observation_digest":"sha256:c6dac40e9e1777b3cecc8b4923fb149c20881081715915fd70a4d7cd366e8ab6","observation_id":"972e99e2-a77d-4d0d-a013-04f2956cd457","resolution":{"observed_at":"2026-08-06T04:32:30.453762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"cited_work":{"arxiv_id":"2501.18009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18009","snapshot_observed_at":"2026-07-03T05:57:41.552773Z","title":"Large Language Models think too fast to explore effectively","venue":null,"work_id":"7942c535-1490-439b-bac7-66ceec888f24","year":2025},"citing_paper":{"arxiv_id":"2605.08057","last_updated":"2026-05-08T17:44:15Z","snapshot_observed_at":"2026-07-31T05:49:37.295093Z","submitted_at":"2026-05-08T17:44:15Z","title":"CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-11T02:28:20.366674Z"},"links":{"cited_paper":"/paper/2501.18009","citing_paper":"/paper/2605.08057"},"observation_digest":"sha256:93cd926de071140831cef545ac70c3d7d551918f4cfe13d494d8381eacd993db","observation_id":"48b77fdc-7ca7-4255-b2a0-50b6eae0c8fa","resolution":{"observed_at":"2026-05-11T03:25:58.103559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"cited_work":{"arxiv_id":"2501.18009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18009","snapshot_observed_at":"2026-07-03T05:57:41.552773Z","title":"Large Language Models think too fast to explore effectively","venue":null,"work_id":"7942c535-1490-439b-bac7-66ceec888f24","year":2025},"citing_paper":{"arxiv_id":"2605.20086","last_updated":"2026-05-19T16:41:45Z","snapshot_observed_at":"2026-08-02T02:17:19.395211Z","submitted_at":"2026-05-19T16:41:45Z","title":"What Do Evolutionary Coding Agents Evolve?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T03:44:18.658541Z"},"links":{"cited_paper":"/paper/2501.18009","citing_paper":"/paper/2605.20086"},"observation_digest":"sha256:d65d9ade47398d884443a75544ace7e3640dad084b96499aba125b13e7107449","observation_id":"ea21c4d0-dbad-4f3f-ac34-a06c413c579f","resolution":{"observed_at":"2026-05-20T03:48:03.308456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"cited_work":{"arxiv_id":"2501.18009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18009","snapshot_observed_at":"2026-07-03T05:57:41.552773Z","title":"Large Language Models think too fast to explore effectively","venue":null,"work_id":"7942c535-1490-439b-bac7-66ceec888f24","year":2025},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2501.18009","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:4f5047a5d2ec8b18b8c69b1471852f9841e15801da336677a4cdab23b93fe886","observation_id":"bfec7fb4-dc77-4fd0-a9d2-a83f27d432ce","resolution":{"observed_at":"2026-07-03T05:57:41.554124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18009/citation-record","integrity":"/paper/2501.18009/integrity","json":"/paper/2501.18009/citation-record.json","paper":"/paper/2501.18009"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.01628","last_updated":"2019-03-25T17:15:45Z","snapshot_observed_at":"2026-08-05T12:41:42.240506Z","submitted_at":"2018-12-04T19:06:00Z","title":"Playing Text-Adventure Games with Graph-Based Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1812.01628","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.01628","snapshot_observed_at":"2026-08-10T01:09:03.293328Z","title":"Playing Text-Adventure Games with Graph-Based Deep Reinforcement Learning","venue":"cs.CL","work_id":"bf14936f-d957-4c86-9d0d-57654ec3ebf3","year":2018},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.076869Z"},"links":{"cited_paper":"/paper/1812.01628","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:87b198d87260454f96bc9504a4dd5eb572c4aecc507e7de7b4ce7388e0c90a76","observation_id":"eb44d2eb-364c-455e-a4b1-ad6895aafccd","resolution":{"observed_at":"2026-08-10T01:09:03.296744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07409","last_updated":"2020-06-12T18:24:06Z","snapshot_observed_at":"2026-08-10T02:02:07.102990Z","submitted_at":"2020-06-12T18:24:06Z","title":"How to Avoid Being Eaten by a Grue: Structured Exploration Strategies for Textual Worlds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07409","snapshot_observed_at":"2026-08-10T01:09:03.080868Z","title":"How to avoid being eaten by a grue: Structured exploration strategies for textual worlds","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.080868Z"},"links":{"cited_paper":"/paper/2006.07409","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:9290d279dc05f3fb2b5683d1ca3711009ff45f629dc39442105da1ef9d7b0798","observation_id":"0f6e2654-c4ef-421d-82e1-fb7c685fe827","resolution":{"observed_at":"2026-08-10T01:09:03.080868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.462938Z","title":"Using cognitive psychology to understand gpt-3","venue":null,"work_id":"1580423c-1fcf-445b-9fb8-019138068d88","year":2023},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.084678Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:c007b3d5bf0b8a8aa326819c05886f3e331bd7324571ea4065555a63dd11ca18","observation_id":"f9965408-97e3-4fe4-af97-fa2bed07f9fd","resolution":{"observed_at":"2026-08-10T01:09:03.466854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.453817Z","title":"R-max-a general polynomial time algorithm for near-optimal reinforcement learning","venue":null,"work_id":"dcf48f33-93e2-4141-9631-0cabcb0823a1","year":2002},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.087470Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:b3051ad35f45a81158b183c7b3bf023083f9b14e22c937acf8257b4a0de5fe07","observation_id":"763eae38-03a3-4aba-81e3-a260273a94b2","resolution":{"observed_at":"2026-08-10T01:09:03.456926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.446288Z","title":"Empowerment contributes to exploration behaviour in a creative video game","venue":null,"work_id":"43e124e4-85ab-44f2-94fd-13acf2aef490","year":2023},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.090829Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:4b14af6e3613cf2299d11f676803719def0a8290bfbe88c520068c51bc3c06bd","observation_id":"9eec93f8-c90a-4047-8ab8-b0b94ffee8b2","resolution":{"observed_at":"2026-08-10T01:09:03.448720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.093864Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.093864Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:f87342d2b486a33ecdcce1708f38e6df9a6753d70276f50c5436f3c27371f32b","observation_id":"cf44b9c5-19f7-4d57-afb5-ab2f39d4af31","resolution":{"observed_at":"2026-08-10T01:09:03.093864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-10T01:09:03.097191Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.097191Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:ff91d5ca8166d6b446bdf57942a745e90a59547e81b16d0f6733b025e4100c28","observation_id":"fcbe40b3-5cb3-44f7-9fb2-4a996caf5ff6","resolution":{"observed_at":"2026-08-10T01:09:03.097191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.435011Z","title":"Cortical substrates for exploratory decisions in humans","venue":null,"work_id":"84b17d35-edaf-4960-a8cc-4346a175dc1d","year":2006},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.100243Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:067ae4058087e88e15228356d8aef82266b56577f69abb9fa4df7e995dc3ec8c","observation_id":"51a2acd4-4494-481f-978e-7c9adcf5a095","resolution":{"observed_at":"2026-08-10T01:09:03.438028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.102779Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.102779Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:e8180fc6a9217d3476e7f157b399db19aaeb90c336bbfd8486e08e584acbeeb8","observation_id":"5392d7aa-c6f4-43d1-b3fe-4c31f5058654","resolution":{"observed_at":"2026-08-10T01:09:03.102779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01280","last_updated":"2024-10-02T06:51:12Z","snapshot_observed_at":"2026-08-10T08:39:20.732970Z","submitted_at":"2024-10-02T06:51:12Z","title":"Sparse Autoencoders Reveal Temporal Difference Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01280","snapshot_observed_at":"2026-08-10T01:09:03.105376Z","title":"Sparse autoencoders reveal temporal difference learning in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.105376Z"},"links":{"cited_paper":"/paper/2410.01280","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:a8a22323c82dfe68233b88cfcfea0130645eba66db20734531d400db927f0996","observation_id":"ba6fb529-0c7c-4a61-a69b-db6ab19120b4","resolution":{"observed_at":"2026-08-10T01:09:03.105376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.108896Z","title":"First return, then explore","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.108896Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:d293e8b7f9f2ba9c6b2ddcbaa018d549b71a56737bdbaa3481b4673baee22d87","observation_id":"ced3f5fc-313a-4cc5-822a-ec16dbfde2d1","resolution":{"observed_at":"2026-08-10T01:09:03.108896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.418936Z","title":"Trait somatic anxiety is associated with reduced directed exploration and underestimation of uncertainty.Nature Human Behaviour, 7(1):102–113, 2023","venue":null,"work_id":"b0399f72-9dc5-4309-958f-3208d8f338ad","year":2023},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.110949Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:e0e2ba72bf04038c9437f548a82772cd3cac52af7e0442cacbf2c2a75ee50b57","observation_id":"6d3e7504-e756-4a18-8f83-3e483a3ea265","resolution":{"observed_at":"2026-08-10T01:09:03.422043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.113474Z","title":"Minedojo: Building open-ended embodied agents with internet-scale knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.113474Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:8c2dadd2853eb47b8bbe00068181e785a99d8263c0dbd854e848ad66fb492f07","observation_id":"726e8a15-2434-4737-aa1f-76f038d988ea","resolution":{"observed_at":"2026-08-10T01:09:03.113474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08922","last_updated":"2023-10-13T07:47:44Z","snapshot_observed_at":"2026-07-06T16:32:23.448967Z","submitted_at":"2023-10-13T07:47:44Z","title":"LLaMA Rider: Spurring Large Language Models to Explore the Open World","version":1},"cited_work":{"arxiv_id":"2310.08922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08922","snapshot_observed_at":"2026-08-10T01:09:03.262894Z","title":"LLaMA Rider: Spurring Large Language Models to Explore the Open World","venue":"cs.LG","work_id":"87997e82-3be7-4364-bf2e-2ba760cf6750","year":2023},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.115898Z"},"links":{"cited_paper":"/paper/2310.08922","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:6895974c9e853c9a25a2b1b701eda6f0128c36d6de3ce26cb5bd7c6a8dbd1da3","observation_id":"ad5e94b9-6e83-475b-ac8e-dc2034019f16","resolution":{"observed_at":"2026-08-10T01:09:03.268260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.407047Z","title":"Deconstructing the human algorithms for exploration","venue":null,"work_id":"d44a121a-19e2-47c4-af5c-cd9cd699ceff","year":2018},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.118855Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:f537a9c17e1b5ceb8150bc1626eddfbdeb3b44e1db32a1572a9ab39039c021f0","observation_id":"e1a2e7ff-ee6a-4a50-928a-408bbc0f152a","resolution":{"observed_at":"2026-08-10T01:09:03.409824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.121367Z","title":"Reinforcement learning: A survey","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.121367Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:d60cf7a317810fbe38c4642f9bcfc32873273c6264251a3fd4c267db4dc70135","observation_id":"f646d2d9-f1d4-46e3-a408-bc6d8100c039","resolution":{"observed_at":"2026-08-10T01:09:03.121367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15371","last_updated":"2024-10-28T19:55:46Z","snapshot_observed_at":"2026-07-06T17:49:07.589781Z","submitted_at":"2024-03-22T17:50:43Z","title":"Can large language models explore in-context?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15371","snapshot_observed_at":"2026-08-10T01:09:03.124230Z","title":"Can large language models explore in-context? arXiv preprint arXiv:2403.15371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.124230Z"},"links":{"cited_paper":"/paper/2403.15371","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:1090f2518271927b832a0108bbf372f234c8ea9a204c85e329a7a6062503565c","observation_id":"31d826d5-7db4-48db-b179-9919e6213feb","resolution":{"observed_at":"2026-08-10T01:09:03.124230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T01:09:03.127804Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.127804Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:5d7268cc8f7a06230440b935778f9ec5fa07184cb4e330a4f29f5e9aa4c12e3e","observation_id":"8c3a197a-5506-4185-a031-2be35b39f2a7","resolution":{"observed_at":"2026-08-10T01:09:03.127804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.395466Z","title":"Sparse autoencoder","venue":null,"work_id":"bcebd566-af36-4d27-bfe2-bc306aecd4d6","year":2011},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.130648Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:5263b49cf1cf7ebcf99b99d880bbce3863d6458d1902cc9821d90495ecabcf5c","observation_id":"d8f26483-fa44-447f-8837-5335f798a3f7","resolution":{"observed_at":"2026-08-10T01:09:03.398242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06238","last_updated":"2025-07-14T15:16:18Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:54:03Z","title":"EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06238","snapshot_observed_at":"2026-08-10T01:09:03.133137Z","title":"Evolve: Evaluating and optimizing llms for exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.133137Z"},"links":{"cited_paper":"/paper/2410.06238","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:3e7ab704308a9a5fb6903f1b9dadb8785fc135267494fd8a639a8da079dea718","observation_id":"df3e06e4-8f88-4a78-a2ae-b32c7dc623f3","resolution":{"observed_at":"2026-08-10T01:09:03.133137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.388347Z","title":"Gpt-4o system card","venue":null,"work_id":"eb667b11-4555-40a1-8a07-7b2f4662ccea","year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.136048Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:de1b4e29f4b535ae821fabb1c592ffd2ee6928184fd17a329b77e088dc45fa5b","observation_id":"f03fb68d-d8ed-4e75-b772-e41361b08504","resolution":{"observed_at":"2026-08-10T01:09:03.390541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.381443Z","title":"Openai o1 system card","venue":null,"work_id":"2685d281-252a-4ace-a17f-353c18b9fbc8","year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.138656Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:00720042a5e15c9854e1564d616e3b12aa900023f1bc22caf5b6e790d0ec322f","observation_id":"84211f5d-33ac-4d31-ba8e-fed898400cf9","resolution":{"observed_at":"2026-08-10T01:09:03.383923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.373215Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":"85156cfe-58e1-4c3b-a764-2661dfa2c3c4","year":2016},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.141184Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:1352b0576728a518e40495a448d043f2654cd5249539a607fd3641f3583e946b","observation_id":"a192a46d-8e53-4128-a15a-f1da6769422c","resolution":{"observed_at":"2026-08-10T01:09:03.376734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.143915Z","title":"(more) efficient reinforcement learning via posterior sampling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.143915Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:25f1f7e8b45dd99fbfc2bc8243ce2e670718760aa2c68e466ee25701a8767ed3","observation_id":"631083e2-1846-46a5-8da7-a53fa8db9947","resolution":{"observed_at":"2026-08-10T01:09:03.143915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.145957Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.145957Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:9271943f548a952bef5c8a73d74a1e1423e7b7a8eecd66ec923266f4a5d90e18","observation_id":"57399b24-7b86-48e8-bdec-89078d078863","resolution":{"observed_at":"2026-08-10T01:09:03.145957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.148868Z","title":"Planning to explore via self-supervised world models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.148868Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:c1d089de6edad27823a70d66810b66c7b6b70a5cae08d4d63e74f588f2bfe044","observation_id":"22109a8a-0872-486e-977c-c6b53990fd08","resolution":{"observed_at":"2026-08-10T01:09:03.148868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-10T01:09:03.150762Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.150762Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:cf432d32e6c2b4da5f58134ec0d592bf93192a5fd1eca59bd307ee3b1db48f2f","observation_id":"7ce9360c-3a80-46a8-a8bb-d903209b1af8","resolution":{"observed_at":"2026-08-10T01:09:03.150762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.353032Z","title":"Uncertainty and exploration in a restless bandit problem","venue":null,"work_id":"4e4836fc-9cb5-4b3c-81e5-759af14f2904","year":2015},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.153123Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:7e949adf03b865cb7c48c02f13b6ec4ad0fc70e7ef3c5cd72a57aa5d9ad73f6c","observation_id":"8f587d81-fb37-4199-b627-ade6122e4b55","resolution":{"observed_at":"2026-08-10T01:09:03.355992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.345309Z","title":"Testing theory of mind in large language models and humans","venue":null,"work_id":"5d46c0d1-a673-40ee-ad55-9c8505f9e591","year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.155209Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:ca9cb5577c19d8c80b23c3310035b896a9c7e57c1d8aa53c69484f454b211aff","observation_id":"08401066-73b3-47b5-a8d8-fa86203acb8a","resolution":{"observed_at":"2026-08-10T01:09:03.348262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.157535Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.157535Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:9d9d214d9f9871351058aafe208c98456793a7d20e6da9ba53548965a9071e32","observation_id":"74d5b198-7bd2-4140-a98e-2ce793934a59","resolution":{"observed_at":"2026-08-10T01:09:03.157535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13718","last_updated":"2024-08-11T01:22:09Z","snapshot_observed_at":"2026-07-06T19:05:36.210400Z","submitted_at":"2024-08-11T01:22:09Z","title":"GPT-4 Emulates Average-Human Emotional Cognition from a Third-Person Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13718","snapshot_observed_at":"2026-08-10T01:09:03.160002Z","title":"Gpt-4 emulates average-human emotional cognition from a third-person perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.160002Z"},"links":{"cited_paper":"/paper/2408.13718","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:4b98557dbf36d178bcad54fccf0386eafc68ef1d548d33b210ac450ef4e3e866","observation_id":"7fcab1a9-bcfc-4eb8-a8d7-3357f319fbaf","resolution":{"observed_at":"2026-08-10T01:09:03.160002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-10T01:09:03.162626Z","title":"V oyager: An open-ended embodied agent with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.162626Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:769131cb400c262d9bc90a6ad63c05d11ff52d0c954bb1b431df583a2a622fb5","observation_id":"29ad2f66-10a0-4326-9125-cd18da858958","resolution":{"observed_at":"2026-08-10T01:09:03.162626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.165299Z","title":"Emergent analogical reasoning in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.165299Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:7c82c579302f7d5075ef90e395de54d5170d75a2be37baebc5ed09c45280b278","observation_id":"a6835e8e-5c8c-4a27-a2ab-234c5c5a2a6c","resolution":{"observed_at":"2026-08-10T01:09:03.165299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.167708Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.167708Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:5201780c3807f6bfa0608b774e58bcb48eb1d50ac0630a26d33ee159e905414d","observation_id":"115ef107-bf98-4814-8fa4-8466e74bc6ca","resolution":{"observed_at":"2026-08-10T01:09:03.167708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.326108Z","title":"Deep exploration as a unifying account of explore-exploit behavior","venue":null,"work_id":"5349f70d-012a-4c40-9392-c2703d246e8e","year":2020},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.170189Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:c44b88642eefc90bb92d3d07e6753dbf214b5c0f711e888046959a48722e1f5a","observation_id":"c2a07405-5492-4385-a4af-e5f061b860ec","resolution":{"observed_at":"2026-08-10T01:09:03.328890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.318218Z","title":"Balancing exploration and exploitation with information and randomization","venue":null,"work_id":"29ff721c-e285-414a-9b7e-a4485ca328a6","year":2021},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.172603Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:29912f4a5a25506c077d1f1d62244ac8a16207ed4c639f5488d6ba1b60dfc8fe","observation_id":"cb2158d4-a2c8-470c-9d3b-22d796a93c68","resolution":{"observed_at":"2026-08-10T01:09:03.321009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.310282Z","title":"Humans use directed and random exploration to solve the explore–exploit dilemma","venue":null,"work_id":"99c6f98b-4556-4ae6-8d96-6e0c4422682f","year":2014},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.175224Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:00ce83a7eff1953a35faf4a482c089ce3b942acba579fffa6ba7db9e959b1847","observation_id":"1635fd9c-ec88-4bb6-afbe-f01b3fd9e088","resolution":{"observed_at":"2026-08-10T01:09:03.313104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04404","last_updated":"2025-02-06T08:52:43Z","snapshot_observed_at":"2026-08-09T00:20:19.377517Z","submitted_at":"2025-02-06T08:52:43Z","title":"Step Back to Leap Forward: Self-Backtracking for Boosting Reasoning of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04404","snapshot_observed_at":"2026-08-10T01:09:03.177968Z","title":"Step back to leap forward: Self-backtracking for boosting reasoning of language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.177968Z"},"links":{"cited_paper":"/paper/2502.04404","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:2d89e275deb016724f23f580490ee25f44d2edaac461cd216b548cc15acf1b66","observation_id":"4a41a0fe-c325-4065-a747-3b976432ab29","resolution":{"observed_at":"2026-08-10T01:09:03.177968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-10T01:09:03.180680Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.180680Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:ba8faf761362424bc8c489f81508e3ea68a448c1d72557b6e0b1ddbb4dbc4399","observation_id":"1b8179e8-8448-4f52-aa77-1a861e57979b","resolution":{"observed_at":"2026-08-10T01:09:03.180680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.11525","last_updated":"2019-03-07T03:17:42Z","snapshot_observed_at":"2026-07-06T06:47:35.336460Z","submitted_at":"2018-06-29T16:40:29Z","title":"Counting to Explore and Generalize in Text-based Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.11525","snapshot_observed_at":"2026-08-10T01:09:03.183501Z","title":"Counting to explore and generalize in text-based games","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.183501Z"},"links":{"cited_paper":"/paper/1806.11525","citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:e3731124f438db97e0b7373eae8e520d9cb345acd68775dda9325a5b35b3d071","observation_id":"0007626a-94a0-478c-9dfd-a5bd9f209ee2","resolution":{"observed_at":"2026-08-10T01:09:03.183501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T01:09:03.301808Z","title":"empowerment","venue":null,"work_id":"f9244835-9997-464a-82de-3db62f6b561e","year":2017},"citing_paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T01:09:03.186224Z"},"links":{"citing_paper":"/paper/2501.18009"},"observation_digest":"sha256:592d9cb7fb86ce85d0fbfffb05888808bf2072c3e7d924ecca5499a5e841e4f6","observation_id":"48ae509c-b699-45dd-95e0-9ccf74f47c1b","resolution":{"observed_at":"2026-08-10T01:09:03.305205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18009","last_updated":"2025-05-12T16:02:08Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T00:58:48.247817Z","submitted_at":"2025-01-29T21:51:17Z","title":"Large Language Models Think Too Fast To Explore Effectively"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 4 inbound Pith citation observations for arXiv:2501.18009."}