{"as_of":"2026-08-08T10:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06b37d61db4cd1dbc1cbe87c845a31e2edb0a402c1a4eee5373bac79f723da89","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:48:43.508912Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16288/citation-record","integrity":"/paper/2506.16288/integrity","json":"/paper/2506.16288/citation-record.json","paper":"/paper/2506.16288"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-07T19:33:04.292595Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-06T23:48:38.888821Z","title":"What learning algorithm is in-context learn- ing? investigations with linear models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:38.888821Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:f9c771a831a82ee0c5087854ad1bee7f4d022c78ab3c32f294abcf5bd8402ec3","observation_id":"94f17705-0efa-4c8f-b421-47824e15711b","resolution":{"observed_at":"2026-08-06T23:48:38.888821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T23:48:39.070148Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.070148Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:d032c79708c213b3f19b278ad93986729ec191d029bebed89ee2a4930a3f224a","observation_id":"40f64f2b-99eb-4057-9109-7f69868ba827","resolution":{"observed_at":"2026-08-06T23:48:39.070148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-06T15:11:19.955049Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-06T23:48:39.299295Z","title":"Analog bits: Gen- erating discrete data using diffusion models with self- conditioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.299295Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:796f59e2e4fb5c61f2c50617a78e5578fda09cf6bf3bc65d5ba67c91d5a10866","observation_id":"71dbcc7d-98ba-4a84-ab08-013cdf62394e","resolution":{"observed_at":"2026-08-06T23:48:39.299295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15618","last_updated":"2022-10-12T10:51:02Z","snapshot_observed_at":"2026-08-07T12:11:16.814079Z","submitted_at":"2022-09-30T17:44:01Z","title":"Beyond Bayes-optimality: meta-learning what you know you don't know","version":2},"cited_work":{"arxiv_id":"2209.15618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15618","snapshot_observed_at":"2026-08-06T23:48:45.150309Z","title":"Beyond Bayes-optimality: meta-learning what you know you don't know","venue":"cs.AI","work_id":"c008ac8d-fd24-43aa-aa91-20f83baf2665","year":2022},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.380074Z"},"links":{"cited_paper":"/paper/2209.15618","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:331f2a6038ad52b07b056085aa12892258989bf936a45a49c74cb3b56ba90af6","observation_id":"23b16767-c8ad-424b-be6e-c6238d866fb9","resolution":{"observed_at":"2026-08-06T23:48:45.294402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14953","last_updated":"2024-01-26T15:37:16Z","snapshot_observed_at":"2026-07-06T17:20:57.937385Z","submitted_at":"2024-01-26T15:37:16Z","title":"Learning Universal Predictors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14953","snapshot_observed_at":"2026-08-06T23:48:39.492242Z","title":"K., Mat- tern, C., Aitchison, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.492242Z"},"links":{"cited_paper":"/paper/2401.14953","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:3688af05ed9d5cd9abad1a363b87cf121dab0227de280b34f80a9e31c31afc0c","observation_id":"b98ce003-2956-457d-a2d4-3bb0cfe13fbf","resolution":{"observed_at":"2026-08-06T23:48:39.492242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T23:48:40.045729Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.045729Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:04e46ee424288fcc3e1604ff5c6e6b61a253de9f3027244e5472f709c373044d","observation_id":"125db3a6-fbdf-40be-ae63-4281e1312b1d","resolution":{"observed_at":"2026-08-06T23:48:40.045729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.04584","last_updated":"2022-08-04T17:36:08Z","snapshot_observed_at":"2026-08-05T21:44:05.382799Z","submitted_at":"2020-12-08T17:36:34Z","title":"Distilling Knowledge from Reader to Retriever for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.04584","snapshot_observed_at":"2026-08-06T23:48:40.164696Z","title":"and Grave, E","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.164696Z"},"links":{"cited_paper":"/paper/2012.04584","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:8fc5bf3c42bfbd43120c386bc3d521170c78b1b72aae314b803bcebbfde8a411","observation_id":"ed593654-ec87-448a-8235-b04e628dcf7c","resolution":{"observed_at":"2026-08-06T23:48:40.164696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18294","last_updated":"2023-05-29T17:59:15Z","snapshot_observed_at":"2026-08-08T01:25:57.713022Z","submitted_at":"2023-05-29T17:59:15Z","title":"Transformer Language Models Handle Word Frequency in Prediction Head","version":1},"cited_work":{"arxiv_id":"2305.18294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18294","snapshot_observed_at":"2026-08-06T23:48:44.803286Z","title":"Transformer Language Models Handle Word Frequency in Prediction Head","venue":"cs.CL","work_id":"a8d6565b-724d-470a-be45-77e3badbbd55","year":2023},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.371506Z"},"links":{"cited_paper":"/paper/2305.18294","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:c8d9b1da656864bde0733de61038cba65249a469b334075c2776ed8d23b375d5","observation_id":"f87cb6d6-18ac-405a-a528-10d6c054c788","resolution":{"observed_at":"2026-08-06T23:48:44.958567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-07-06T20:01:54.557848Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03782","snapshot_observed_at":"2026-08-06T23:48:40.536842Z","title":"K., Chan, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.536842Z"},"links":{"cited_paper":"/paper/2412.03782","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:1b95e8cf7f1c9033e00f6677dde3ba385224ece8688b75225e7446e3ae0fc95c","observation_id":"b78e2f5f-391b-4bd1-b70d-39754051f770","resolution":{"observed_at":"2026-08-06T23:48:40.536842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02429","last_updated":"2025-01-13T14:58:30Z","snapshot_observed_at":"2026-07-06T17:25:01.583656Z","submitted_at":"2024-02-04T09:58:42Z","title":"Towards an Information Theoretic Framework of Context-Based Offline Meta-Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2402.02429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02429","snapshot_observed_at":"2026-08-06T23:48:44.480044Z","title":"Towards an Information Theoretic Framework of Context-Based Offline Meta-Reinforcement Learning","venue":"cs.LG","work_id":"618c283c-16c5-4267-b673-9c70aba34ed7","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.652267Z"},"links":{"cited_paper":"/paper/2402.02429","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:5cd12deef0a0ed86125a2608f835eaec5996369c9f53e8d847741607c4e68c71","observation_id":"91c82530-462e-4fb2-ac1a-cfab562b3042","resolution":{"observed_at":"2026-08-06T23:48:44.606108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04220","last_updated":"2024-08-08T05:06:22Z","snapshot_observed_at":"2026-07-31T11:42:40.848517Z","submitted_at":"2024-08-08T05:06:22Z","title":"Diffusion Guided Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04220","snapshot_observed_at":"2026-08-06T23:48:40.869877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.869877Z"},"links":{"cited_paper":"/paper/2408.04220","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:c5ba277060114f4dc1f2d88b209a3d1fcc78b1e74821eeb0b73fa1031efc196f","observation_id":"1a72bd3e-90a2-4d86-92b3-d484694218d9","resolution":{"observed_at":"2026-08-06T23:48:40.869877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06859","last_updated":"2021-11-24T21:46:41Z","snapshot_observed_at":"2026-07-06T10:49:06.028323Z","submitted_at":"2021-03-11T18:42:39Z","title":"Understanding the Origin of Information-Seeking Exploration in Probabilistic Objectives for Control","version":7},"cited_work":{"arxiv_id":"2103.06859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.06859","snapshot_observed_at":"2026-08-06T23:48:44.144976Z","title":"Understanding the Origin of Information-Seeking Exploration in Probabilistic Objectives for Control","venue":"cs.LG","work_id":"7771af4c-7fcc-40c7-8e1d-cf0cb4f4b071","year":2021},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.014232Z"},"links":{"cited_paper":"/paper/2103.06859","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:c330a12dd1608ff897a0fff39c15e3500a0e0f6e5468c582f61596f9242920d1","observation_id":"c1a8465b-4d2a-4521-ba30-05d75ae518f3","resolution":{"observed_at":"2026-08-06T23:48:44.297349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T23:48:41.238404Z","title":"Webgpt: Browser-assisted question-answering with hu- man feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.238404Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:cae98b8a45b4774db5742dc11b0ce9f001c13f9d8df90f55287237fd0ff5a895","observation_id":"23b4a6d8-3547-4ea7-808a-152654af5fbd","resolution":{"observed_at":"2026-08-06T23:48:41.238404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17717","last_updated":"2024-11-04T18:48:34Z","snapshot_observed_at":"2026-07-06T17:36:23.851926Z","submitted_at":"2024-02-27T17:52:33Z","title":"AmbigNLG: Addressing Task Ambiguity in Instruction for NLG","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17717","snapshot_observed_at":"2026-08-06T23:48:41.424893Z","title":"and Iso, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.424893Z"},"links":{"cited_paper":"/paper/2402.17717","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:58f00f8317aaf7de2b09f64ed36ec91ef8962da935ded89e920fe017a2e417fc","observation_id":"cf58b1a5-6f91-427f-b6e4-1bad83f42003","resolution":{"observed_at":"2026-08-06T23:48:41.424893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T23:48:41.546923Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.546923Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:d0f73754f9f58522a65aacddd60a7df588385e11930c45af12df3c9b4baa71cb","observation_id":"e4193223-d037-41a5-b8ec-363c7b52f2dd","resolution":{"observed_at":"2026-08-06T23:48:41.546923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T23:48:41.642535Z","title":"Ortega, P","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.642535Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:13309de83b7cf41c2cf9675ef22555772bc64412653633c84b957c50a0269fde","observation_id":"959c59fe-03a0-44dc-8958-dd15504a0437","resolution":{"observed_at":"2026-08-06T23:48:41.642535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04891","last_updated":"2024-04-14T05:12:52Z","snapshot_observed_at":"2026-08-07T21:36:08.711693Z","submitted_at":"2023-06-08T02:38:23Z","title":"In-Context Learning through the Bayesian Prism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04891","snapshot_observed_at":"2026-08-06T23:48:41.749879Z","title":"Peebles, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.749879Z"},"links":{"cited_paper":"/paper/2306.04891","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:cac17ed2d01172b259f977185c07a401b624ddb02da6301a9f61ddb7911fe0cb","observation_id":"0d42f79b-8470-4740-a33c-c4b25df37a28","resolution":{"observed_at":"2026-08-06T23:48:41.749879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T23:48:41.998582Z","title":"Scaling llm test- time compute optimally can be more effective than scal- ing model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.998582Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:aec5bce747583c751c668e2b82e522d412e4eefcc60a33469defcfb95b845a4d","observation_id":"53ed3057-9575-420f-9188-a7e0bbb29143","resolution":{"observed_at":"2026-08-06T23:48:41.998582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-07-30T03:45:35.558793Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-06T23:48:42.183377Z","title":"M., Raghunathan, A., Liang, P., and Ma, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.183377Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:2ed3291d200bf2d89af0f08b1c80780902379a99fc0af5d7611db88cf63cff8f","observation_id":"6068db52-04e5-46c5-96ca-47914c2b3bc1","resolution":{"observed_at":"2026-08-06T23:48:42.183377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09240","last_updated":"2025-01-16T01:54:23Z","snapshot_observed_at":"2026-07-06T20:21:46.651618Z","submitted_at":"2025-01-16T01:54:23Z","title":"Task Vectors in In-Context Learning: Emergence, Formation, and Benefit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09240","snapshot_observed_at":"2026-08-06T23:48:42.310398Z","title":"Task vectors in in-context learning: Emergence, for- mation, and benefit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.310398Z"},"links":{"cited_paper":"/paper/2501.09240","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:4344795c2b59c883d62f17f8d4a366cebe9d4d13e3a013bd2bb83d921fda91d3","observation_id":"58e0303e-f69c-461b-8d9b-bd0b818e5ba0","resolution":{"observed_at":"2026-08-06T23:48:42.310398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09469","last_updated":"2023-11-16T00:18:50Z","snapshot_observed_at":"2026-08-04T05:49:28.331204Z","submitted_at":"2023-11-16T00:18:50Z","title":"Clarify When Necessary: Resolving Ambiguity Through Interaction with LMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09469","snapshot_observed_at":"2026-08-06T23:48:42.490680Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.490680Z"},"links":{"cited_paper":"/paper/2311.09469","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:88b2e543778b91044c282f6762782032d7a80d61cd0131af932a6ec6c2614b18","observation_id":"7f75c7c1-d6dc-4921-9410-b8353192be3b","resolution":{"observed_at":"2026-08-06T23:48:42.490680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05629","last_updated":"2025-02-19T22:48:13Z","snapshot_observed_at":"2026-07-06T19:29:27.705770Z","submitted_at":"2024-10-08T02:25:38Z","title":"Vector-ICL: In-context Learning with Continuous Vector Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05629","snapshot_observed_at":"2026-08-06T23:48:42.605607Z","title":"Vector- icl: In-context learning with continuous vector represen- tations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.605607Z"},"links":{"cited_paper":"/paper/2410.05629","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:120d9769cb91f4d9e86b1169882707270335d77ad6764e6006f91f4b48d1e97d","observation_id":"77733cb0-0401-4916-b3d1-dc960aa3e031","resolution":{"observed_at":"2026-08-06T23:48:42.605607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.787462Z","title":"Xie et al","venue":null,"work_id":"b9a381e6-0419-4cf9-b0ef-87f3adfcbe94","year":2021},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.741580Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:002b0e2b797cb5a70ae6b571e404092ac9958c0cec711182a261efc2ac722e16","observation_id":"868fc8cb-55c4-4a2e-b94c-fbed6863a8de","resolution":{"observed_at":"2026-08-06T23:48:46.889631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.614426Z","title":null,"venue":null,"work_id":"e13a2014-7ca7-4c38-b5fd-2ddea402b233","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.823175Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:85ce5987dda08d45904f4ffd46516d0e0d10aed70ae792a2fa556019e3f5d7e2","observation_id":"71b5a4f0-f8ce-4d67-a11d-6a2dfd777247","resolution":{"observed_at":"2026-08-06T23:48:46.702266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.383782Z","title":null,"venue":null,"work_id":"0af10a12-2f86-475b-bfe3-98ad4f16210c","year":1996},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.952881Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:d24b031ed639212f71c2184962b25a298c664395a6a604c8321d6d80efff2a0d","observation_id":"5659bdfb-af6b-4c01-a924-426f72d2284b","resolution":{"observed_at":"2026-08-06T23:48:46.485297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.225424Z","title":"Further, system prompts, such as those used in chatbots, serve to disambiguate the model’s role and task (Niwa & Iso, 2024)","venue":null,"work_id":"a5c2f491-9332-4480-a0ad-22a5707caa17","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.067435Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:02f81990f70b7743477fa4b6c80aab2e3b3732295cc07dc6a65d85342f09af6a","observation_id":"9619e619-8938-4e72-a1a0-08ad34992a98","resolution":{"observed_at":"2026-08-06T23:48:46.313999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.007252Z","title":"However, theses methods enhance can be seen as addressing cases where the conditional prediction p(xt | x<t, θ), not the task inference, is too difficult for the model","venue":null,"work_id":"c3af8942-c1ac-4afc-8f1b-0c4d28114057","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.185025Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:ef2465fe69cc53a851318c68e96f168c523b070351bc2411a2f635e015633df0","observation_id":"55fd4966-d295-4cdc-ac4c-7e2843e73a11","resolution":{"observed_at":"2026-08-06T23:48:46.090531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:45.788739Z","title":"In transformers, this has evolved into early exiting mechanisms (Zhu, 2021), which conditionally terminate processing","venue":null,"work_id":"35d8f926-1397-470a-82f7-d895789046bf","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.231353Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:3c2c837aba98cacaa113ca310145ffd7d5531a5c6d0f135161e17564cdd69066","observation_id":"08868ebf-e618-41fb-b51d-4c5e835334ad","resolution":{"observed_at":"2026-08-06T23:48:45.881161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:45.539195Z","title":"Additionally, the embedding z may encode high- frequency details from xctx that are hard to sample accurately","venue":null,"work_id":"02984ca2-de17-418d-9f00-b8a7904077a2","year":2022},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.356491Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:f9391deb11723be10c8062ec6d7c262e052853e5ce28fb8468cc279c767811d5","observation_id":"c138dcd4-b4b3-4915-b30b-0a1d8337a34a","resolution":{"observed_at":"2026-08-06T23:48:45.606173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:45.391394Z","title":"Other hyperparameters are the same as in (Lovelace et al., 2023)","venue":null,"work_id":"fbe30c07-080c-476f-ada7-99f1140059eb","year":2023},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.508912Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:132b7de8e99e0817da61aea896ca5ff1ae5b88709819f70c1863bc41df4fbb3c","observation_id":"b21875f1-a162-41c1-a70b-9780dbcbf530","resolution":{"observed_at":"2026-08-06T23:48:45.442634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-06T23:48:41.826889Z","title":"and Ho, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.826889Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:5237a7fe6a7364197c41229b208bdab1dc538b6387308224561e733e47525369","observation_id":"a29f8fdb-ee3a-4cb0-a9e1-091b23fe9896","resolution":{"observed_at":"2026-08-06T23:48:41.826889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1037/a0020511","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:43.656135Z","title":"Schick, T., Dwivedi-Yu, J., Dess`ı, R., Raileanu, R., Lomeli, M., Hambro, E., Zettlemoyer, L., Cancedda, N., and Scialom, T","venue":null,"work_id":"37fb26e3-3734-4516-82c6-c103a7c11442","year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.913211Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:c5667bd1083c73016e605f07d0a6e4afae162e387b08ebcd956199ec2ad1d8b3","observation_id":"381b1a20-d609-4fcd-8eff-a75cfa8244d3","resolution":{"observed_at":"2026-08-06T23:48:43.860153Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:48:39.789296Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.789296Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:8eac02ceecda31e5e9819972c33b886c2b480199e37dc715fe41e0b70de61a38","observation_id":"b5b9b46a-6e8e-4a24-9594-38619402dfe5","resolution":{"observed_at":"2026-08-06T23:48:39.789296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.174597Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.174597Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:72890f803634a1d89c1de1e5dd83499cba8d106c7531a2af40af341ee64f0e79","observation_id":"c2151987-b613-4adf-9ef4-067511a0b3bb","resolution":{"observed_at":"2026-08-06T23:48:39.174597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-08T01:23:24.701475Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-06T23:48:42.090341Z","title":"L., Sharma, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.090341Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:988571fb5dd610cf96a6a51bb4d0eed76f4073087789c2c7bfda864801cdfb7d","observation_id":"9225116f-b9dc-4673-a31f-deaa807e29eb","resolution":{"observed_at":"2026-08-06T23:48:42.090341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.982020Z","title":"Do llms un- derstand ambiguity in text? a case study in open-world question answering","venue":null,"work_id":"cf56d602-cab1-42c5-a2b0-d73187eba008","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.267678Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:4032cacd595f1f1140f7dc9b91a7a495c97008754efd807a4f1be5e72e84146d","observation_id":"ad3e892c-8a99-4457-a61d-9d0a1c7a44c4","resolution":{"observed_at":"2026-08-06T23:48:47.065482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19162","last_updated":"2025-06-14T23:01:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T15:06:10Z","title":"Does learning the right latent variables necessarily improve in-context learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19162","snapshot_observed_at":"2026-08-06T23:48:41.127955Z","title":"Does learning the right latent variables necessarily improve in-context learning? arXiv preprint arXiv:2405.19162,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.127955Z"},"links":{"cited_paper":"/paper/2405.19162","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:b4de785fbaa403f6008953b5f5bbd0a87c4fbef13a9bbfefe5339d86bb02e903","observation_id":"5763f258-be75-44b1-9827-cc292dce71bb","resolution":{"observed_at":"2026-08-06T23:48:41.127955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12973","last_updated":"2024-01-30T18:59:34Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T18:59:21Z","title":"In-Context Language Learning: Architectures and Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12973","snapshot_observed_at":"2026-08-06T23:48:38.966817Z","title":"In-context language learning: Architectures and algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:38.966817Z"},"links":{"cited_paper":"/paper/2401.12973","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:250533f80aa602ad7f01634dcc26bfab2aee2ad312f581bf48323507b9959d35","observation_id":"e1e8f6b3-cd97-4661-ace3-9b8430c64eb2","resolution":{"observed_at":"2026-08-06T23:48:38.966817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07971","last_updated":"2023-03-14T15:24:05Z","snapshot_observed_at":"2026-08-06T13:04:22.551600Z","submitted_at":"2023-03-14T15:24:05Z","title":"A Theory of Emergent In-Context Learning as Implicit Structure Induction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07971","snapshot_observed_at":"2026-08-06T23:48:39.925862Z","title":"Hendel, R., Geva, M., and Globerson, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.925862Z"},"links":{"cited_paper":"/paper/2303.07971","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:f1b9fca7765d9ce0dc9db52d61692a8219e7592230441e6047c3941cb286b5b9","observation_id":"0f53c2e4-135e-4923-a896-8eb5ef557d51","resolution":{"observed_at":"2026-08-06T23:48:39.925862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-06T23:48:39.631083Z","title":"Adaptive computation time for recurrent neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.631083Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:6e44f287e3554eb4edca166bc7ac75b3b214b39e9b45f5895a9035079d53cb4e","observation_id":"2f038ec8-d941-4055-87ed-93ea990b4feb","resolution":{"observed_at":"2026-08-06T23:48:39.631083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14399","last_updated":"2023-10-20T05:46:14Z","snapshot_observed_at":"2026-08-07T21:55:21.214220Z","submitted_at":"2023-04-27T17:57:58Z","title":"We're Afraid Language Models Aren't Modeling Ambiguity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14399","snapshot_observed_at":"2026-08-06T23:48:40.728627Z","title":"A., and Choi, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.728627Z"},"links":{"cited_paper":"/paper/2304.14399","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:3b307ebc286d9fde11732879e0e48ee98f64f65f22b0f25c2e7d250347d7f11d","observation_id":"90f3bcfb-2ae8-4fa9-805e-d66dce55b5d2","resolution":{"observed_at":"2026-08-06T23:48:40.728627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:25:18.645727Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":5,"verified_fuzzy":7},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.16288."}