{"as_of":"2026-08-07T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c00325cae76312014352aef49b3e78982ef7479c2e78a5d805e9d9a5845ee13","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:24:26.960285Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:48:30.813878Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:37:25.557248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"cited_work":{"arxiv_id":"2506.14448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14448","snapshot_observed_at":"2026-07-02T22:37:25.557248Z","title":"arXiv preprint arXiv:2506.14448 , year=","venue":null,"work_id":"622b6687-9be8-4cc7-8a04-fd6f6d6620ef","year":null},"citing_paper":{"arxiv_id":"2606.08656","last_updated":"2026-06-07T14:53:19Z","snapshot_observed_at":"2026-08-02T07:02:48.509018Z","submitted_at":"2026-06-07T14:53:19Z","title":"From Player to Master: Enhancing Test-Time Learning of LLM Agents via Reinforcement Learning over Memory","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T18:48:30.813878Z"},"links":{"cited_paper":"/paper/2506.14448","citing_paper":"/paper/2606.08656"},"observation_digest":"sha256:e607a605cd989a691e391b36e6a6b6427f24e1f14559ed435ccc6107a614308e","observation_id":"bada8048-acc7-44a9-9366-d65717504109","resolution":{"observed_at":"2026-07-02T22:37:25.558920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14448/citation-record","integrity":"/paper/2506.14448/integrity","json":"/paper/2506.14448/citation-record.json","paper":"/paper/2506.14448"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:23.786452Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:23.786452Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:055960308fba6c2ee838f0d30547714241931ceb3297a4d9da446ad800bb8fc6","observation_id":"7f894705-7617-445f-8c1b-2b17ce80d21a","resolution":{"observed_at":"2026-08-07T00:24:23.786452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:23.859578Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:23.859578Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:117af0597395c1f13388fbfddce903ca8d0c052c18acd59a4fed59091d8d8f75","observation_id":"3dd77321-6e4e-4a94-aace-179706d84337","resolution":{"observed_at":"2026-08-07T00:24:23.859578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T00:24:23.916722Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:23.916722Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:07c1d8d8f3bcd4a3c7e006adee2e3628ac027f7181154ea55d649d1462bf18d1","observation_id":"bb8ea895-684c-4635-99f3-d9721e5a0e1a","resolution":{"observed_at":"2026-08-07T00:24:23.916722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:24:24.013600Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.013600Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:1c4b3e531e089f7cebb78fe2c479df893e8ca252d2912dfc3049719b7b6bb589","observation_id":"b4d3df70-0895-4a22-b42d-a4c059332ce1","resolution":{"observed_at":"2026-08-07T00:24:24.013600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.112801Z","title":null,"venue":null,"work_id":"41fe635c-b42a-4239-ba3c-2f426008730a","year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.080497Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:b425cd69ca422ac77345124f89949b47f6906b11f1b3cc93106e01a3875068e0","observation_id":"c29089f0-f925-4735-9590-1650f110ef0c","resolution":{"observed_at":"2026-08-07T00:24:30.153815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:24.170968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.170968Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:825f933cf17d86d701d292ce69e2f1fe07a6b9c94864c80ca21cc7933a8cc17a","observation_id":"75ab87cd-d0fa-4021-9bcb-abe44b8215b0","resolution":{"observed_at":"2026-08-07T00:24:24.170968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:24.254343Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.254343Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:e37c4da9647e7ec145221e526780524cc16ae2c5e30b72259701376c426b8c2f","observation_id":"ac3da65f-7370-49dc-b9df-67f934ddbf01","resolution":{"observed_at":"2026-08-07T00:24:24.254343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:24:24.333492Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.333492Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:744d943ffc77f7cbbd5b8fc29e286542a328fe8dd6b4ff5c9689fef966680ef8","observation_id":"b7f39ecf-b494-496b-9b11-0469089520fe","resolution":{"observed_at":"2026-08-07T00:24:24.333492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-07T00:24:24.397362Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.397362Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:470443edaa4f3903bebf8e2f0574f84ad523cc82009a153b8e6467b3849e4596","observation_id":"9cfcd0bb-fadb-4e6b-8ccf-fde2171ef875","resolution":{"observed_at":"2026-08-07T00:24:24.397362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.951211Z","title":null,"venue":null,"work_id":"b74e1fb0-116d-4731-8244-11ac6cdde25c","year":2022},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.455525Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:7965b3913f00e912851b687329a629a0bacd75db806be2654541cea1f2eb1ad5","observation_id":"ae836f5d-2ec9-4190-ab73-636145995dc8","resolution":{"observed_at":"2026-08-07T00:24:30.005234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.804467Z","title":null,"venue":null,"work_id":"bc43e3c3-a0da-49f6-aeb0-764a6c604f9a","year":2011},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.511202Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:5fde8d3cd9965305828c83ba6b33c5915226f815025b0b7765b3fc698cceaddd","observation_id":"d9002957-21d9-4875-a897-03d251502dee","resolution":{"observed_at":"2026-08-07T00:24:29.877594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.654339Z","title":"Amago: Scalable in-context reinforcement learning for adaptive agents","venue":null,"work_id":"8deb06e8-bc35-4811-8d4f-fd857540cf29","year":null},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.568343Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:6ee67a74fe18ac4a06ae5ac21362f2a50faf3dc5eb16c3ec00215baff65e6f4b","observation_id":"9e67fbb3-4309-435e-a7bb-998a4539be9f","resolution":{"observed_at":"2026-08-07T00:24:29.723566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:24:24.623902Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.623902Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:9ca2335057e504ee02462dbf410654765d1a13842aeaef2a37266277e735345d","observation_id":"ba936084-338a-4836-8f68-876ad2fc79ea","resolution":{"observed_at":"2026-08-07T00:24:24.623902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T00:24:24.682267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.682267Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:24107a1e6f0a56757e103599bd2e0dd0fe92199fb17a967353b348577fa91cd3","observation_id":"4e48c53b-f9ff-4c69-9468-c13145611a1f","resolution":{"observed_at":"2026-08-07T00:24:24.682267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T00:24:24.783283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.783283Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:197deb9353f388cf872f86215733f4ca8a4ed9e3518114320260be56ab8ac048","observation_id":"ad5dd136-440b-4ddf-8c69-b71d2f8a32f5","resolution":{"observed_at":"2026-08-07T00:24:24.783283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02907","last_updated":"2023-06-05T14:12:46Z","snapshot_observed_at":"2026-07-30T22:08:01.137808Z","submitted_at":"2023-06-05T14:12:46Z","title":"SelfEvolve: A Code Evolution Framework via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02907","snapshot_observed_at":"2026-08-07T00:24:24.831453Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.831453Z"},"links":{"cited_paper":"/paper/2306.02907","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:774a5b5bc2287b2ac5b30952c13ca47649e5d12b2d3c43027dc3a2b6a6b44888","observation_id":"12608b17-a6aa-4d7f-97d5-7625df16776e","resolution":{"observed_at":"2026-08-07T00:24:24.831453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.445755Z","title":null,"venue":null,"work_id":"4bd6a924-3ed1-4be6-bfd3-d165b98e277e","year":2002},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:24.881597Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:d5776137fa82bf8c375e40ef9930b85829e4fa756b8c669cba740595cb66fe4b","observation_id":"2b5855c9-6d5c-4dd9-8bee-06200e41d7e9","resolution":{"observed_at":"2026-08-07T00:24:29.538934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.251966Z","title":null,"venue":null,"work_id":"f7f5c0ab-25d1-43cb-b9b3-04a26d1060fa","year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.014205Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:c630a4ae2a11e906bf289c1d617d1e5da2f0f7d81bdac5c6fe1997b87afb8412","observation_id":"bba2ab71-24b2-488c-b42d-8d7e8f632fa1","resolution":{"observed_at":"2026-08-07T00:24:29.358637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.048863Z","title":"In-context reinforcement learning with algorithm distillation","venue":null,"work_id":"4f04398d-3619-435f-bf20-355a3454c06e","year":null},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.090138Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:65c812700b9adc79287294c74b5b635a53d77e614188eab430384842e87f63e7","observation_id":"3b1caedf-ded2-4acc-a86c-4754fe1e3c96","resolution":{"observed_at":"2026-08-07T00:24:29.146080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.877309Z","title":null,"venue":null,"work_id":"cfe67000-0858-44f1-9f8e-edb1f0931659","year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.170461Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:06c9598d3f4f86b3e707d6b1e6c05de9a34b03143ddead01315ab1d3d73f6ba6","observation_id":"4c6af786-b0d3-4876-890e-8458e295b795","resolution":{"observed_at":"2026-08-07T00:24:28.960005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:24:25.256888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.256888Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:59502cd732d8fb21dfdf1ecf670549c7122365892686144461909e02c298d7fe","observation_id":"47ec9c2b-cedd-4086-a6e1-e12d4bed5258","resolution":{"observed_at":"2026-08-07T00:24:25.256888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.607471Z","title":null,"venue":null,"work_id":"4872df5d-e233-481b-a1e4-63deaa9535d6","year":2021},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.350340Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:ddad9ceea257ed3c54b83057b333ffaf42310373736ed3ac0f938088804ee018","observation_id":"573640db-7a0d-4cfd-a009-6ce75db25cc0","resolution":{"observed_at":"2026-08-07T00:24:28.760291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.404727Z","title":null,"venue":null,"work_id":"c7384eb3-3fb8-4ed9-a7b8-4cd7bdb98ca2","year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.479508Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:ed5e9d3bde16769893413c37575c9c1294bae5ce262a20eff329aadcb87232e1","observation_id":"5071ce91-e83c-46c5-91d4-ad1c1eda275a","resolution":{"observed_at":"2026-08-07T00:24:28.498765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.146351Z","title":null,"venue":null,"work_id":"fdb2609b-e949-41af-a950-dc48c0e6f75a","year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.552776Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:9ca619fea4d5cc77bf074b15979882c25004b98ab7d75039dc703fc541bb3801","observation_id":"73be322b-c6bf-45bc-9a77-51b52d489d37","resolution":{"observed_at":"2026-08-07T00:24:28.249737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08568","last_updated":"2025-05-27T07:40:36Z","snapshot_observed_at":"2026-08-04T15:08:40.203853Z","submitted_at":"2023-06-14T15:18:48Z","title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08568","snapshot_observed_at":"2026-08-07T00:24:25.657136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.657136Z"},"links":{"cited_paper":"/paper/2306.08568","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:46c9d07f843d1c0a84596248cc593d721badc4d8fba24d12faee822ae8fcfe7c","observation_id":"16619bf5-2e33-4f78-b84c-67bd1957301d","resolution":{"observed_at":"2026-08-07T00:24:25.657136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.979735Z","title":null,"venue":null,"work_id":"45845af6-7d44-4c68-9688-131fb035bc3a","year":2025},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.734272Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:be6d17a6c254dd29b74f73753012f563eaefc1c4ea34c19b653cdb3121043dc8","observation_id":"9ec30262-2949-4f68-9c9c-9d176f8d17af","resolution":{"observed_at":"2026-08-07T00:24:28.070041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:25.851359Z","title":null,"venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.851359Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:2a3a5f635a72ded970111db561163d8fdab324a29c981175d567c304fb1562ea","observation_id":"50a679f9-b410-483b-b832-9b35f0a99539","resolution":{"observed_at":"2026-08-07T00:24:25.851359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01859","last_updated":"2023-03-03T11:25:33Z","snapshot_observed_at":"2026-07-06T14:58:18.255439Z","submitted_at":"2023-03-03T11:25:33Z","title":"POPGym: Benchmarking Partially Observable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01859","snapshot_observed_at":"2026-08-07T00:24:25.955282Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:25.955282Z"},"links":{"cited_paper":"/paper/2303.01859","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:d2485fbb56f9bf9d79f559789634932ab5d0626eea3a1b8de989337eb004393c","observation_id":"923dfd12-a7d8-45a1-ab01-8732785c259d","resolution":{"observed_at":"2026-08-07T00:24:25.955282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13996","last_updated":"2024-01-25T07:47:49Z","snapshot_observed_at":"2026-08-03T10:55:26.752756Z","submitted_at":"2024-01-25T07:47:49Z","title":"Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13996","snapshot_observed_at":"2026-08-07T00:24:26.043298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.043298Z"},"links":{"cited_paper":"/paper/2401.13996","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:0b0dcc2f3be408e32327f3f5a43c20bdd1eca8ed342497921cb0c7a7b38a1be9","observation_id":"02ef6cc0-cd2b-4919-9ef7-840083d83377","resolution":{"observed_at":"2026-08-07T00:24:26.043298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.842201Z","title":null,"venue":null,"work_id":"807e9364-46e8-4c5e-8460-0341f1d4993b","year":2025},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.131603Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:ee9b0a4ba183d42c788b59693e6f77ff2306944d4ad01ea27fc5bdad0f6132dc","observation_id":"5b7c9f4d-3da1-4bed-b0ac-24bc2df53085","resolution":{"observed_at":"2026-08-07T00:24:27.925468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.671489Z","title":null,"venue":null,"work_id":"e4e2c06c-0b21-4178-9458-04676e004f9a","year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.237012Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:a44783cf82f3a14e6d4f263d368292761c221f3bc132f87b14c7f85b25eed337","observation_id":"8023024d-db22-4845-85ff-8ddb260776a7","resolution":{"observed_at":"2026-08-07T00:24:27.763206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:26.328652Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.328652Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:2229b77492b06c9ef06188031da5575d408166f123c3067200ebd235068d68f1","observation_id":"5f30a8df-16de-4e8e-86ce-a5ff348464a1","resolution":{"observed_at":"2026-08-07T00:24:26.328652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.477800Z","title":null,"venue":null,"work_id":"5aba7389-304f-4897-acda-1d4bb297ff99","year":2019},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.426949Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:e28b72820a0dd848a6e7bbfdd4ee8042fd047ebbeb502084d7c4bf7353b5895d","observation_id":"fe21e204-5cd9-4e77-9bd2-4bc281f6dd26","resolution":{"observed_at":"2026-08-07T00:24:27.572140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07952","last_updated":"2025-04-10T17:57:33Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-10T17:57:33Z","title":"Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07952","snapshot_observed_at":"2026-08-07T00:24:26.491541Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.491541Z"},"links":{"cited_paper":"/paper/2504.07952","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:a078fb1bf47e1229a0037d9026ceba83eb618dadc0b2c2dbea704c800c2db1b5","observation_id":"c2ad8fd8-3413-4166-9fde-dfe714fb6a3d","resolution":{"observed_at":"2026-08-07T00:24:26.491541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14387","last_updated":"2024-06-03T17:47:30Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:43:23Z","title":"A Survey on Self-Evolution of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14387","snapshot_observed_at":"2026-08-07T00:24:26.554434Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.554434Z"},"links":{"cited_paper":"/paper/2404.14387","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:3c083c8206ec2d151271e1270d527962a42c738bdb63c6f1ca98546d62edc6e5","observation_id":"6bf691fe-db50-4fee-9b98-96c3a4b4752c","resolution":{"observed_at":"2026-08-07T00:24:26.554434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08562","last_updated":"2024-11-27T12:25:28Z","snapshot_observed_at":"2026-07-06T16:47:37.217467Z","submitted_at":"2023-11-14T21:46:27Z","title":"MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08562","snapshot_observed_at":"2026-08-07T00:24:26.690889Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.690889Z"},"links":{"cited_paper":"/paper/2311.08562","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:253c704cb453fabe08da190bf692a8e52487112d8e3e6b8cc4dbf2f99fa2be2d","observation_id":"6b4784a3-2c23-40a1-b635-1fd39b2e067a","resolution":{"observed_at":"2026-08-07T00:24:26.690889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:26.798146Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.798146Z"},"links":{"citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:92dc52e378e67e180fb9f292084013097d6bb896f417a7aac744d334a7067e4f","observation_id":"f1ec01af-17f8-4dd0-8250-045b5c5082d9","resolution":{"observed_at":"2026-08-07T00:24:26.798146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15313","last_updated":"2025-04-20T06:43:23Z","snapshot_observed_at":"2026-08-02T07:32:22.530211Z","submitted_at":"2025-04-20T06:43:23Z","title":"PolicyEvol-Agent: Evolving Policy via Environment Perception and Self-Awareness with Theory of Mind","version":1},"cited_work":{"arxiv_id":"2504.15313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15313","snapshot_observed_at":"2026-08-07T00:24:27.122060Z","title":"PolicyEvol-Agent: Evolving Policy via Environment Perception and Self-Awareness with Theory of Mind","venue":"cs.AI","work_id":"8aa11900-756a-4369-966e-584f6485d0b8","year":2025},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.878378Z"},"links":{"cited_paper":"/paper/2504.15313","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:1f47685177049a039743cb6ed69efc9897bcca64f435df70f79d074de35ecba6","observation_id":"e475ccbc-afae-471d-ad57-36119217c0b6","resolution":{"observed_at":"2026-08-07T00:24:27.227107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-05T01:30:13.153471Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T00:24:26.960285Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.960285Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:5b7c7e8cfb49c72e74167b18f85e29f857037fdcc82a0e2a791e1322c70109dd","observation_id":"0cfb8b71-f14a-44d6-b8f3-c7a381c3cc12","resolution":{"observed_at":"2026-08-07T00:24:26.960285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.14448."}