{"as_of":"2026-08-22T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d10c75708d6ce6916cfcebc54416ab96bb94ae85703215291f1607bdc8de4806","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:54:39.421494Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:40:27.771507Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2504.02181","last_updated":"2026-04-22T01:49:17Z","snapshot_observed_at":"2026-07-30T09:24:14.725185Z","submitted_at":"2025-04-02T23:51:27Z","title":"A Survey of Scaling in Large Language Model Reasoning","version":2},"reference_index":189,"source":"pdf_text","source_observed_at":"2026-05-22T21:20:07.238992Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2504.02181"},"observation_digest":"sha256:d8e9ba3afc40149fd84709dbe8a6f470223e2a56bb372b0d60b2e30a1d2c7484","observation_id":"4e0d9e0a-28f1-4682-a39f-c1c5e1863568","resolution":{"observed_at":"2026-05-22T21:22:08.794718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-16T11:40:27.771507Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-19T04:05:23.903349Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.771507Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:bdb57779ed0ba3d52ce980f3ac8ac2e13cbc50d49025390518169859e6712076","observation_id":"ffa160b7-62b5-4451-9cee-ba8cc6e5f20b","resolution":{"observed_at":"2026-08-16T11:40:27.771507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-07T10:30:34.382006Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05333","last_updated":"2025-06-20T01:25:25Z","snapshot_observed_at":"2026-08-07T10:18:59.977399Z","submitted_at":"2025-06-05T17:59:24Z","title":"Kinetics: Rethinking Test-Time Scaling Laws","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:30:34.382006Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2506.05333"},"observation_digest":"sha256:2f273008085ffb13bbfdf02e9b35f15d6d5f893e55c5d790bf844d38dab20c65","observation_id":"1f9d6edd-9263-434b-b776-3b3437af8323","resolution":{"observed_at":"2026-08-07T10:30:34.382006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-06T22:55:46.262459Z","title":"LLM pretraining with continuous concepts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20354","last_updated":"2025-08-25T13:34:45Z","snapshot_observed_at":"2026-08-16T00:41:24.343968Z","submitted_at":"2025-06-25T12:07:10Z","title":"A foundation model with multi-variate parallel attention to generate neuronal activity","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:55:46.262459Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2506.20354"},"observation_digest":"sha256:9cd1d1d00d3b46c0091e2394655944ccf16a7afcc7a8d72d8674d26d16c6304c","observation_id":"3959c756-5e25-421b-b86a-7fa6cc9f9be9","resolution":{"observed_at":"2026-08-06T22:55:46.262459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-06T22:14:19.808871Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-16T02:38:41.777371Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.808871Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:f7beb8b6fc9ed4d0f3900cd1efc4a67da95967e61e9e4933aaa7dcab7569e0e9","observation_id":"e9f46559-0637-4498-a104-7320a4abcc83","resolution":{"observed_at":"2026-08-06T22:14:19.808871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T11:39:36.759475Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02350","last_updated":"2025-09-02T14:16:02Z","snapshot_observed_at":"2026-08-16T00:20:00.216356Z","submitted_at":"2025-09-02T14:16:02Z","title":"Implicit Reasoning in Large Language Models: A Comprehensive Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T11:39:36.759475Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2509.02350"},"observation_digest":"sha256:b5b550e5738817155640370c51c78fb34f1dc1f5f3e696250e3f9e498104d7f1","observation_id":"3281b352-bf5a-4ab0-83ec-ce80173c72f3","resolution":{"observed_at":"2026-08-05T11:39:36.759475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-04T00:15:16.513242Z","title":"Llm pretraining with continuous concepts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02360","last_updated":"2026-05-26T12:26:50Z","snapshot_observed_at":"2026-08-19T23:11:42.441399Z","submitted_at":"2025-11-04T08:28:46Z","title":"LaRe: Latent Refocusing for Multimodal Reasoning","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T00:15:16.513242Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2511.02360"},"observation_digest":"sha256:da68089f2eb7f22fe0c39e612ed5dbad8a857534127fab9648f6ee751278fe74","observation_id":"0c4a3242-f36c-4ba6-b8b7-61579dc05215","resolution":{"observed_at":"2026-08-04T00:15:16.513242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"LLM pretraining with continuous concepts.CoRR, abs/2502.08524, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":196,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:ba4a28f63811fe17708cf7a05a9d6e15deb5c0859d04926b18bf94c204a1c5df","observation_id":"49da501c-ea80-4c50-9e14-3297463d8dc9","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2604.17892","last_updated":"2026-05-11T03:02:30Z","snapshot_observed_at":"2026-08-12T22:16:31.802071Z","submitted_at":"2026-04-20T07:05:12Z","title":"LEPO: Latent Reasoning Policy Optimization for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T05:45:50.406959Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2604.17892"},"observation_digest":"sha256:8623019af5911823009756550f99c4290fc93943730e7bf97c47d88aa60b3e2d","observation_id":"563aa1fc-bd0a-4c8b-ae3c-2846ce007c50","resolution":{"observed_at":"2026-05-10T05:46:09.869259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2604.21027","last_updated":"2026-08-02T16:15:42Z","snapshot_observed_at":"2026-08-10T23:41:30.183421Z","submitted_at":"2026-04-22T19:18:36Z","title":"HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-09T23:51:47.724033Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2604.21027"},"observation_digest":"sha256:9a848afd2ec417db80b1e09dc05251019afd0d6ded21dedc0138d2efb4058425","observation_id":"73909bf1-8873-46a6-ad32-f7ba0130d606","resolution":{"observed_at":"2026-05-09T23:54:45.137827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2605.06285","last_updated":"2026-05-07T13:56:13Z","snapshot_observed_at":"2026-08-13T21:32:42.386381Z","submitted_at":"2026-05-07T13:56:13Z","title":"LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T10:27:00.257353Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.06285"},"observation_digest":"sha256:2ad1a95aa689e83828b92344c0b63cdd086a2edad71bee733d21b7c9663222dd","observation_id":"31659c60-6c27-4512-8158-429d649dbce5","resolution":{"observed_at":"2026-05-11T20:01:12.073029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2605.20075","last_updated":"2026-05-19T16:28:53Z","snapshot_observed_at":"2026-08-21T20:38:03.435821Z","submitted_at":"2026-05-19T16:28:53Z","title":"CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T05:25:51.655208Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.20075"},"observation_digest":"sha256:284f12ed8401a1f52eba45e561aa3361ea1ad46746afc84531d4010ff35e00e3","observation_id":"3812236f-747b-44f0-a585-107309943a5e","resolution":{"observed_at":"2026-05-20T05:28:04.793043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-30T12:23:42.587689Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:52ee31dd254bd52a355fb92859c529860538213efcda194524f41ddc48f3207b","observation_id":"dfdefbf8-0b3f-4d05-a234-543fdc0ceff0","resolution":{"observed_at":"2026-06-30T12:24:39.194388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-04T00:38:33.708836Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:f2e81ff7a049e95d0aedaf4b394ae1721b7b20b84e9190f6aa59fffa1fa48b5c","observation_id":"720668a7-825d-4c95-a79b-b749c11ce05c","resolution":{"observed_at":"2026-07-04T00:39:16.257287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:c56e3382df6410f4c87c01a8613aab349323f26cf070fce9e796202f5f2397e9","observation_id":"80db826e-7060-4cb0-b06e-9e99428f908b","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2605.27734","last_updated":"2026-05-26T22:16:42Z","snapshot_observed_at":"2026-08-13T02:13:33.819892Z","submitted_at":"2026-05-26T22:16:42Z","title":"Learn from your own latents and not from tokens: A sample-complexity theory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T18:22:40.908929Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.27734"},"observation_digest":"sha256:a1773c4d29bb5a96a37f8bef95561c3ab6a09f30cf970bc1e6c4208bce652554","observation_id":"1bb8e52f-601f-4ac6-b2e2-de24ce4ad896","resolution":{"observed_at":"2026-06-29T18:23:50.223099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2605.30343","last_updated":"2026-05-28T17:59:49Z","snapshot_observed_at":"2026-08-12T16:50:40.669907Z","submitted_at":"2026-05-28T17:59:49Z","title":"Unlocking the Working Memory of Large Language Models for Latent Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T08:02:05.390732Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2605.30343"},"observation_digest":"sha256:37d2d13b758a46b9e54268a47d8a21de1f9fec78e309841806fd8762cc79ebfb","observation_id":"b58f78ff-db56-47d7-b67e-f93805d42449","resolution":{"observed_at":"2026-06-29T08:03:13.922213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:f7ff6e01e0acc296059b89a0a2d8f4310c9f38345782d5219d77af69e7f2f33e","observation_id":"857c626d-7c49-4ea9-917c-847b4a225a69","resolution":{"observed_at":"2026-06-28T23:32:46.627650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":"2502.08524","doi":"10.48550/arxiv.2502.08524","metadata_source":"pith","pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524","venue":"cs.LG","work_id":"31a0f43f-f03f-4bb9-8312-eaaa9ce433d0","year":2025},"citing_paper":{"arxiv_id":"2607.06648","last_updated":"2026-07-07T16:09:44Z","snapshot_observed_at":"2026-08-18T01:45:18.553444Z","submitted_at":"2026-07-07T16:09:44Z","title":"Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-11T00:27:52.555374Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2607.06648"},"observation_digest":"sha256:f74cbeb036d9e64cc3257b72d05a4c373d9f342d67ba399d2ebc435d773b2955","observation_id":"ddf34b57-8542-4937-8107-2ec9681cd422","resolution":{"observed_at":"2026-07-11T00:37:43.265957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08524/citation-record","integrity":"/paper/2502.08524/integrity","json":"/paper/2502.08524/citation-record.json","paper":"/paper/2502.08524"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T04:54:39.269793Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.269793Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:e9d0871c8894cb5c002faa020f3a4cedb0675229b8c60eb385b74b2654676943","observation_id":"70ce4d20-5606-489e-8464-8873fe115a0a","resolution":{"observed_at":"2026-08-08T04:54:39.269793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-08T04:54:39.280782Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.280782Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:01706eb31d46a28b3cc154d233a7a914c78ba54f5551c19dcb9654c697764d88","observation_id":"6995f843-6bb6-462c-93e1-aff7e85b49e4","resolution":{"observed_at":"2026-08-08T04:54:39.280782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T04:54:39.291932Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.291932Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:bdf4f84d64870f6dc8983c236155b9fdabe2cf36cd6d947b82217849fa76367b","observation_id":"2c57982a-0ba5-455f-b6df-0fdb59de392e","resolution":{"observed_at":"2026-08-08T04:54:39.291932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08640","last_updated":"2023-06-28T05:00:35Z","snapshot_observed_at":"2026-08-16T15:23:54.330945Z","submitted_at":"2023-06-14T17:12:56Z","title":"AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08640","snapshot_observed_at":"2026-08-08T04:54:39.297648Z","title":"Assistgpt: A general multi-modal assistant that can plan, execute, inspect, and learn.arXiv preprint arXiv:2306.08640,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.297648Z"},"links":{"cited_paper":"/paper/2306.08640","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:f4f5c5468b27b0d14659cdd7c29722d69eb2d703d82283d1fa7dd987f8448c53","observation_id":"ca7a76e4-8a62-44d9-87d0-cce56ebf2776","resolution":{"observed_at":"2026-08-08T04:54:39.297648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-08T04:54:39.302858Z","title":"Scaling and evaluating sparse autoencoders.arXiv preprint arXiv:2406.04093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.302858Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:a06cc41b098ed2ca315fec9312f025ca6e326bb551f9d6e6b260b0ca602f9c62","observation_id":"eb8c4dec-efd5-4ed0-b1cf-fff501116883","resolution":{"observed_at":"2026-08-08T04:54:39.302858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17215","last_updated":"2025-03-19T00:03:30Z","snapshot_observed_at":"2026-08-16T13:06:53.834278Z","submitted_at":"2024-10-22T17:40:32Z","title":"MiniPLM: Knowledge Distillation for Pre-Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17215","snapshot_observed_at":"2026-08-08T04:54:39.307725Z","title":"Miniplm: Knowledge distillation for pre-training language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.307725Z"},"links":{"cited_paper":"/paper/2410.17215","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:661cd27d9aa5c11fc5baeb7d22a05e044bf6d62b8e8ab1b262fcec2cc719cbaf","observation_id":"654413b9-704c-431e-849e-de4cb7ab02e5","resolution":{"observed_at":"2026-08-08T04:54:39.307725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-17T06:12:37.525438Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-08T04:54:39.313421Z","title":"Training large language models to reason in a continuous latent space.arXiv preprint arXiv:2412.06769,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.313421Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:ec2f838031890ed1168d7a5e93f2236dc564bedfc468d2d3aac3737601ba633d","observation_id":"329e6b1f-9aaa-4b11-bf5e-19f78a067d63","resolution":{"observed_at":"2026-08-08T04:54:39.313421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-08T04:54:39.319043Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.319043Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:d3d76ee7cc18686e2dbdd3ee71321a60af8e0f36803ef337e0f5db6a3e1f9aed","observation_id":"2f08ce55-b6f8-410c-98bf-cc948defd65b","resolution":{"observed_at":"2026-08-08T04:54:39.319043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08821","last_updated":"2024-12-15T21:20:12Z","snapshot_observed_at":"2026-08-16T08:10:37.041600Z","submitted_at":"2024-12-11T23:36:20Z","title":"Large Concept Models: Language Modeling in a Sentence Representation Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08821","snapshot_observed_at":"2026-08-08T04:54:39.324272Z","title":"Large concept models: Language modeling in a sentence representation space.arXiv preprint arXiv:2412.08821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.324272Z"},"links":{"cited_paper":"/paper/2412.08821","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:1a8f66dc3c50ef891f99df9dc9fd815938f3168cef30e03c31af1c2441ff757e","observation_id":"a6096342-a395-41a8-9d9f-303c102c5783","resolution":{"observed_at":"2026-08-08T04:54:39.324272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-15T15:50:24.074149Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-08T04:54:39.330610Z","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2.arXiv preprint arXiv:2408.05147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.330610Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:f037a846b0640859479748c9bad7505822998dd96ac28f2408de037eda0b3d32","observation_id":"4e812e43-1633-4be2-9ae8-9156c926c1da","resolution":{"observed_at":"2026-08-08T04:54:39.330610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T04:54:39.336491Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.336491Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:846777d58607cac7b5056015a7c298d1aeb9647c0e52f1bb07b12af054a0f98c","observation_id":"d2836ea7-38e3-486b-a59c-24988a3151f6","resolution":{"observed_at":"2026-08-08T04:54:39.336491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-08T04:54:39.364183Z","title":"Code llama: Open foundation models for code.arXiv preprint arXiv:2308.12950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.364183Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:9ac08354f25d4a0bafcf8377623aaf04982f08c678c0751ea91b1bde61056729","observation_id":"7862238f-be87-4d00-9142-f0067f09fd5b","resolution":{"observed_at":"2026-08-08T04:54:39.364183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-08T04:54:39.369463Z","title":"Very deep convolutional networks for large-scale image recognition.arXiv preprint arXiv:1409.1556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.369463Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:e3061b5e71d3a8670b67716944485b11010ab9a9d02a65c3910da52f9ca012bd","observation_id":"9e5c6412-4262-4403-a520-bed940c2b047","resolution":{"observed_at":"2026-08-08T04:54:39.369463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-21T05:15:28.840279Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-08T04:54:39.374645Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.374645Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:4492b2ffd37b1ea6fcdda15351465f8c6482e27e1ad172d916ce44f56a8f49c4","observation_id":"4ad03885-c99a-4063-a5b4-18148c1f35f3","resolution":{"observed_at":"2026-08-08T04:54:39.374645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:39.964530Z","title":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou, et al","venue":null,"work_id":"d3dc8e77-ce84-4333-87bd-d6be74381475","year":2024},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.379863Z"},"links":{"citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:412ae9b9be439fc948306833c97da33e5b22a5aa2d5a8ab05af40d86777f354c","observation_id":"db8e37c5-f6ee-4792-a9c8-dd9307818a09","resolution":{"observed_at":"2026-08-08T04:54:39.969965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04538","last_updated":"2023-06-21T12:19:09Z","snapshot_observed_at":"2026-08-18T00:28:02.863869Z","submitted_at":"2023-06-07T15:44:14Z","title":"Evaluation of ChatGPT and Microsoft Bing AI Chat Performances on Physics Exams of Vietnamese National High School Graduation Examination","version":3},"cited_work":{"arxiv_id":"2306.04538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.04538","snapshot_observed_at":"2026-08-08T04:54:39.514786Z","title":"Evaluation of ChatGPT and Microsoft Bing AI Chat Performances on Physics Exams of Vietnamese National High School Graduation Examination","venue":"physics.ed-ph","work_id":"a0544af3-aed8-498e-91b7-29db1feae7cd","year":2023},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.384838Z"},"links":{"cited_paper":"/paper/2306.04538","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:18df397396a8d80163fbb52d6f82088f74ddbf1bb2e44207908ec0e19d2914fb","observation_id":"52478968-0718-47e1-8060-d0e336b4f5de","resolution":{"observed_at":"2026-08-08T04:54:39.522927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06023","last_updated":"2024-07-24T18:40:36Z","snapshot_observed_at":"2026-08-17T02:05:35.367393Z","submitted_at":"2024-07-08T15:17:46Z","title":"Distilling System 2 into System 1","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06023","snapshot_observed_at":"2026-08-08T04:54:39.389971Z","title":"Distilling system 2 into system 1.arXiv preprint arXiv:2407.06023,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.389971Z"},"links":{"cited_paper":"/paper/2407.06023","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:f58661ef94e37c476e6ef443091a42091a9358e74ca11b8e2ede6b90e7f687f9","observation_id":"549a592e-5b9d-4877-890b-469fe03712f6","resolution":{"observed_at":"2026-08-08T04:54:39.389971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15949","last_updated":"2023-04-04T06:43:19Z","snapshot_observed_at":"2026-08-17T13:04:26.585781Z","submitted_at":"2021-03-29T20:51:33Z","title":"Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15949","snapshot_observed_at":"2026-08-08T04:54:39.394799Z","title":"Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors.arXiv preprint arXiv:2103.15949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.394799Z"},"links":{"cited_paper":"/paper/2103.15949","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:0ba6eb3f504436ee956a99d6123b83f1d80a513eef166170bf43d5c99871838b","observation_id":"4a1532da-f258-47d4-8e8d-40b4e0fc68e7","resolution":{"observed_at":"2026-08-08T04:54:39.394799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-08T04:54:39.400356Z","title":"Representation engineering: A top-down approach to ai transparency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.400356Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:d75e331979ac2af1907235c0791bd78bcdbf6da960306cb255e1d19a583bf68e","observation_id":"b578b36d-6fbb-49e3-95d7-74bec819cd32","resolution":{"observed_at":"2026-08-08T04:54:39.400356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:39.946316Z","title":"Our method and baseline both utilize the GPT-2-based Transformer architecture and tokenizer (Radford et al., 2019), with a context length of","venue":null,"work_id":"e706889b-9973-4e6c-8cac-155b0d74a5ee","year":2019},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.405653Z"},"links":{"citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:adfe1eff545500a09b3761a4f939ed5e029896ae2bc3932177acf7b536b2647b","observation_id":"3f751cd2-f452-4a7b-b04b-c249dc62e023","resolution":{"observed_at":"2026-08-08T04:54:39.952345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:39.909820Z","title":"Consequently, our models introduce an additional(C + Kconcept) × d activated parameters on top of the base Transformer parameters","venue":null,"work_id":"85239dba-9bb4-468e-8d79-2ad44de9713d","year":2020},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.416054Z"},"links":{"citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:8784e37731d3d3c0ee401f787c14ec37cf0cef7c65f4d2159b6a46e724ac16cf","observation_id":"3fad0500-06e3-4d2d-bb8d-bbfedbd74ff9","resolution":{"observed_at":"2026-08-08T04:54:39.915153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:39.893385Z","title":"Latent concept modeling is a","venue":null,"work_id":"72994306-44e0-45c1-8954-012e0bd12dca","year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.421494Z"},"links":{"citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:8720502be2c2b12b2f7d7178ade7d188ba67e263b2a37cd444abb779f2310923","observation_id":"6daeb9f7-e9a3-49cd-a87a-8775bb20ce3e","resolution":{"observed_at":"2026-08-08T04:54:39.898587Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:39.927260Z","title":"For CoCoMix, the hidden state dimensionsd are 512, 1024, and 2028, with 8, 24, and 24 layers, respectively","venue":null,"work_id":"8d2fb943-693a-4c20-bd87-f1acf8f33b2d","year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.411003Z"},"links":{"citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:5a9731589dab276ca7afc9b1091861ea588206bb2a56afe1638fe10b9ace6465","observation_id":"fbe4797f-a9e9-4286-ab91-f0bfb5fc2ae7","resolution":{"observed_at":"2026-08-08T04:54:39.933400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-08-14T07:35:01.333549Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-08T04:54:39.342599Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models.arXiv preprint arXiv:2403.19647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.342599Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:bfb63033b63d0ecf58eaa14eebea8a3590b7feb0b5f6377dea9eb4a247a4fba3","observation_id":"f7eaeea9-c1b1-47e5-a0fa-75acd4cc7612","resolution":{"observed_at":"2026-08-08T04:54:39.342599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06786","last_updated":"2023-10-10T16:57:28Z","snapshot_observed_at":"2026-08-18T23:26:43.616423Z","submitted_at":"2023-10-10T16:57:28Z","title":"OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06786","snapshot_observed_at":"2026-08-08T04:54:39.353679Z","title":"Openwebmath: An open dataset of high-quality mathematical web text.arXiv preprint arXiv:2310.06786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.353679Z"},"links":{"cited_paper":"/paper/2310.06786","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:7f12520f7248d272265d6d9ffc7cd4ac90ce19ee957476c64d9230d19aa32e00","observation_id":"fe0813bb-bf0c-4247-af1c-f7270a4f9eae","resolution":{"observed_at":"2026-08-08T04:54:39.353679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-08T04:54:39.348326Z","title":"Show your work: Scratchpads for intermediate computation with language models.arXiv preprint arXiv:2112.00114,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.348326Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:83e2affceacba6c0da58063684864cead4969f4151409853755a4b1df2891663","observation_id":"551de2d2-9abc-4e3e-8fc2-a578f465e342","resolution":{"observed_at":"2026-08-08T04:54:39.348326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-21T17:39:12.921162Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-08T04:54:39.275380Z","title":"Sparse autoencoders find highly interpretable features in language models.arXiv preprint arXiv:2309.08600,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.275380Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:b54d15d2b3d7d19db3d0ba88a192cd0771c99edfcb75ed9871159026655b2c1c","observation_id":"a3f613b6-363e-4383-a17e-3d6b5a4e3cc8","resolution":{"observed_at":"2026-08-08T04:54:39.275380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18779","last_updated":"2024-10-24T14:31:52Z","snapshot_observed_at":"2026-08-16T13:06:15.485087Z","submitted_at":"2024-10-24T14:31:52Z","title":"A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18779","snapshot_observed_at":"2026-08-08T04:54:39.359172Z","title":"A little help goes a long way: Efficient llm training by leveraging small lms.arXiv preprint arXiv:2410.18779,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.359172Z"},"links":{"cited_paper":"/paper/2410.18779","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:b7a7816123a03a543b84c360253ded8cf7238cc37e52f96d86b8122189b9edd0","observation_id":"26b2ce15-01b2-4115-8fea-05981e86e29f","resolution":{"observed_at":"2026-08-08T04:54:39.359172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-19T17:57:39.331233Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-08T04:54:39.263903Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.263903Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:ba4f7086891d7f5a70775ec05ab88c5bcca83d0e8746bcd611f1e9e4679d14b0","observation_id":"67942a3d-9f06-488c-b455-241cb2094f85","resolution":{"observed_at":"2026-08-08T04:54:39.263903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:39.982597Z","title":"Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"ec24ceb3-cbd4-4def-a09a-9aa70b4d6c58","year":2023},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.257905Z"},"links":{"citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:dcc5aa7889af1553e1805d40f88b63e8bf4f7eb01e489a28c550f09e71fa238c","observation_id":"6233ff7e-b64e-48c4-853d-51ba1a4faf96","resolution":{"observed_at":"2026-08-08T04:54:39.987870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01460","last_updated":"2023-11-02T17:59:49Z","snapshot_observed_at":"2026-08-19T20:10:00.657591Z","submitted_at":"2023-11-02T17:59:49Z","title":"Implicit Chain of Thought Reasoning via Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01460","snapshot_observed_at":"2026-08-08T04:54:39.286449Z","title":"Implicit chain of thought reasoning via knowledge distillation.arXiv preprint arXiv:2311.01460,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:39.286449Z"},"links":{"cited_paper":"/paper/2311.01460","citing_paper":"/paper/2502.08524"},"observation_digest":"sha256:829038290914457a58ea056a80cf40e937812245c02a6e31e843b1c3fa62be6d","observation_id":"6c35d17c-690d-4149-b86d-164ad2a0344e","resolution":{"observed_at":"2026-08-08T04:54:39.286449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T12:16:31.453744Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 19 inbound Pith citation observations for arXiv:2502.08524."}