{"as_of":"2026-08-18T19:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d03a0cf63c4a30d1a368515d76b068505adb23c8c3934da437458bdccf0a86db","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:40:21.640422Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T04:46:33.641714Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:49:02.953758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"cited_work":{"arxiv_id":"2504.17562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nitish Shirish Keskar, Bryan McCann, Lav R","venue":null,"work_id":"9448d1a2-91c1-4ab7-a6d6-88c1abd83a5b","year":null},"citing_paper":{"arxiv_id":"2511.21613","last_updated":"2026-04-19T02:59:16Z","snapshot_observed_at":"2026-08-14T09:49:16.350511Z","submitted_at":"2025-11-26T17:36:31Z","title":"Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T04:46:33.641714Z"},"links":{"cited_paper":"/paper/2504.17562","citing_paper":"/paper/2511.21613"},"observation_digest":"sha256:ea55b403c92528b3187a37cefaf9697f2897ee7085e49eda28efc6e1a130c891","observation_id":"3d3eda9a-55b6-4fcf-8478-9f2759dde147","resolution":{"observed_at":"2026-05-17T04:49:02.956416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17562/citation-record","integrity":"/paper/2504.17562/integrity","json":"/paper/2504.17562/citation-record.json","paper":"/paper/2504.17562"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.06955","last_updated":"2021-07-14T19:39:31Z","snapshot_observed_at":"2026-08-18T16:03:01.216710Z","submitted_at":"2021-07-14T19:39:31Z","title":"HTLM: Hyper-Text Pre-Training and Prompting of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06955","snapshot_observed_at":"2026-08-16T10:40:21.569567Z","title":"Htlm: Hyper-text pre-training and prompting of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.569567Z"},"links":{"cited_paper":"/paper/2107.06955","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:4c758416918a37995258e2fda138f5d92e4eded060eed797f81fdeab8906e321","observation_id":"5f6a8e5f-4826-437a-bd56-fb07154f952c","resolution":{"observed_at":"2026-08-16T10:40:21.569567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02164","last_updated":"2020-03-03T05:33:49Z","snapshot_observed_at":"2026-08-13T14:14:59.271697Z","submitted_at":"2019-12-04T18:32:15Z","title":"Plug and Play Language Models: A Simple Approach to Controlled Text Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02164","snapshot_observed_at":"2026-08-16T10:40:21.597843Z","title":"Sumanth Dathathri, Andrea Madotto, Janice Lan, Jane Hung, Eric Frank, Piero Molino, Jason Yosinski, and Rosanne Liu","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.597843Z"},"links":{"cited_paper":"/paper/1912.02164","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:c15e5b0e75cb7564f3f6b4814291603a25c7b749f8e95055d9ffef055b360e8c","observation_id":"5ca024e4-4918-47e3-bf12-a9e51078cda4","resolution":{"observed_at":"2026-08-16T10:40:21.597843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07971","last_updated":"2023-03-14T15:24:05Z","snapshot_observed_at":"2026-08-16T15:48:17.798712Z","submitted_at":"2023-03-14T15:24:05Z","title":"A Theory of Emergent In-Context Learning as Implicit Structure Induction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07971","snapshot_observed_at":"2026-08-16T10:40:21.607260Z","title":"Michael Hahn and Navin Goyal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.607260Z"},"links":{"cited_paper":"/paper/2303.07971","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:eecdb33afce95b0efc6943eb7d845771c3708c8853ff125848912d7209ff7e3a","observation_id":"29d8bd5e-f1ac-48ef-b137-78c7c3bb4333","resolution":{"observed_at":"2026-08-16T10:40:21.607260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05858","last_updated":"2019-09-20T20:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-11T17:57:18Z","title":"CTRL: A Conditional Transformer Language Model for Controllable Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05858","snapshot_observed_at":"2026-08-16T10:40:21.611507Z","title":"Ctrl: A conditional transformer language model for controllable generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.611507Z"},"links":{"cited_paper":"/paper/1909.05858","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:7fc03ba2871f2e2b565f952e1841be4f71f02c7221d95c792b540ee8e9d12b47","observation_id":"5da20810-687a-4991-a0a4-8bb7687e7b92","resolution":{"observed_at":"2026-08-16T10:40:21.611507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01019","last_updated":"2024-08-13T03:55:35Z","snapshot_observed_at":"2026-08-18T16:02:33.935189Z","submitted_at":"2024-04-01T09:39:38Z","title":"Source-Aware Training Enables Knowledge Attribution in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01019","snapshot_observed_at":"2026-08-16T10:40:21.615899Z","title":"Source-aware training enables knowledge attribution in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.615899Z"},"links":{"cited_paper":"/paper/2404.01019","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:c4cdc5e6d44d58ee95c274f3ba3b65d8b6f2acc784e8dc9f799297dd1505b902","observation_id":"5e9c4b23-e569-4400-9b61-08e4f262930b","resolution":{"observed_at":"2026-08-16T10:40:21.615899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15047","last_updated":"2024-07-12T18:03:25Z","snapshot_observed_at":"2026-08-16T14:49:41.945174Z","submitted_at":"2023-10-23T15:50:08Z","title":"Implicit meta-learning may lead language models to trust more reliable sources","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15047","snapshot_observed_at":"2026-08-16T10:40:21.620137Z","title":"Implicit meta-learning may lead language models to trust more reliable sources","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.620137Z"},"links":{"cited_paper":"/paper/2310.15047","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:890805eb1e4300f562a194ac44a566b2ab387260f0816c1c7a3feceecd3aa47b","observation_id":"0c8d3eb8-84ea-472b-a12a-d0bfcf67ede1","resolution":{"observed_at":"2026-08-16T10:40:21.620137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.624364Z","title":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timoth´ee Lacroix, Baptiste Rozi `ere, Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.624364Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:86c05cd92aadf4ee67926384f87303c4a152222aebadf54062ffd614c8b6c9c9","observation_id":"fad96e55-2756-4869-9d56-10ff2f9de7b7","resolution":{"observed_at":"2026-08-16T10:40:21.624364Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01976","last_updated":"2024-06-04T05:22:24Z","snapshot_observed_at":"2026-08-18T16:02:32.852399Z","submitted_at":"2024-06-04T05:22:24Z","title":"Conditional Language Learning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01976","snapshot_observed_at":"2026-08-16T10:40:21.628207Z","title":"Xiao Zhang, Miao Li, and Ji Wu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.628207Z"},"links":{"cited_paper":"/paper/2406.01976","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:d3753ab60cded2d730fa9ca482556d33f45fff659f47c33ef05cf4c87e232d49","observation_id":"59c8a36f-fe50-424f-a446-ae69a9dcffd0","resolution":{"observed_at":"2026-08-16T10:40:21.628207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.915636Z","title":"Deciphering the impact of pretraining data on large language models through machine unlearning","venue":null,"work_id":"7d636389-a6f4-4802-aa33-780811cc60c7","year":2024},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.632162Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:b1292bdc1e3dea27c8e0ddebe497d27083d05c61c21bd3a1a42bd03174f2ef59","observation_id":"196d73a5-9b48-4591-8ac3-6c4af658c168","resolution":{"observed_at":"2026-08-16T10:40:21.919692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.903465Z","title":"12 Published as a conference paper at COLM 2025 A More Details of the Experimental Setting Training Setting","venue":null,"work_id":"ee15c853-2be6-42ee-a0a8-fbf08bf07876","year":2023},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.636242Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:2e96805769dfe79332874b24479d55336616d800a8f6f77d1faf497e226fff15","observation_id":"a849e908-be1c-4485-8680-ec13837d9ccb","resolution":{"observed_at":"2026-08-16T10:40:21.907550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.888619Z","title":"B The loss of next-token prediction for various token positions","venue":null,"work_id":"bbd19cd0-dd37-4045-9d57-bfe07901dfa2","year":2021},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.640422Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:efae1ef6d9f5c62aa72a6b84a88d40b4e1b1d375e71f57cdbffb948c1013b337","observation_id":"cbefdf3e-f022-4134-8587-64e57b6af8f0","resolution":{"observed_at":"2026-08-16T10:40:21.895155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:40:21.592365Z","title":"URL https: //aclanthology.org/P18-1198/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.592365Z"},"links":{"citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:a69eca95a5ce37ea660231f75c29e21c2a9df29a5555052ac42431328713ad30","observation_id":"88cdee63-919e-4970-a1ce-fae8ab7d020f","resolution":{"observed_at":"2026-08-16T10:40:21.592365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T10:40:21.602496Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.602496Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:66e26ebe94686668415c830d4cd2a4af64cfa81936351d1a0bbd32fb7284d5fa","observation_id":"e3d15d29-0f1d-41c5-811b-1d81e8edf486","resolution":{"observed_at":"2026-08-16T10:40:21.602496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03535","last_updated":"2022-06-10T03:58:27Z","snapshot_observed_at":"2026-08-10T06:46:03.370194Z","submitted_at":"2020-06-05T16:15:46Z","title":"CoCon: A Self-Supervised Approach for Controlled Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03535","snapshot_observed_at":"2026-08-16T10:40:21.587527Z","title":"URL https://aclanthology","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.587527Z"},"links":{"cited_paper":"/paper/2006.03535","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:72e5d03600646292163bb80d395a23a056509eea660ec4c453301d6afb270197","observation_id":"804b2c0f-49a5-4f8b-bb7f-bceea1a77a75","resolution":{"observed_at":"2026-08-16T10:40:21.587527Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-16T14:02:46.982560Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-16T10:40:21.578676Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.578676Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:a847bebc9b5c2a2d60c65a424a56b29754dc192aa489cae05de6254fb001e66d","observation_id":"705191bd-db36-43d6-966a-6c590f03ffbf","resolution":{"observed_at":"2026-08-16T10:40:21.578676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15936","last_updated":"2023-11-06T00:36:24Z","snapshot_observed_at":"2026-08-16T22:55:19.544394Z","submitted_at":"2023-07-29T09:22:54Z","title":"A Theory for Emergence of Complex Skills in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15936","snapshot_observed_at":"2026-08-16T10:40:21.582670Z","title":"A theory for emergence of complex skills in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.582670Z"},"links":{"cited_paper":"/paper/2307.15936","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:89771deaaad398dbcfeb941fc2f874e1a15cc5fcbaf1be2abc618af3bfbbe90c","observation_id":"6c110442-d4c6-442d-8a5d-30f0951b371a","resolution":{"observed_at":"2026-08-16T10:40:21.582670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13673","last_updated":"2025-05-19T11:12:27Z","snapshot_observed_at":"2026-08-18T16:00:47.608550Z","submitted_at":"2023-05-23T04:28:16Z","title":"Physics of Language Models: Part 1, Learning Hierarchical Language Structures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13673","snapshot_observed_at":"2026-08-16T10:40:21.574336Z","title":"Zeyuan Allen-Zhu and Yuanzhi Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:21.574336Z"},"links":{"cited_paper":"/paper/2305.13673","citing_paper":"/paper/2504.17562"},"observation_digest":"sha256:50177964266c5b0f8239086a0f549db5d371cb1971b0f5fabd4c8087288c78df","observation_id":"99c4e181-5b57-431c-97e9-36560abea958","resolution":{"observed_at":"2026-08-16T10:40:21.574336Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.17562","last_updated":"2025-07-27T05:42:28Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T18:04:48.940397Z","submitted_at":"2025-04-24T13:56:43Z","title":"When Does Metadata Conditioning (NOT) Work for Language Model Pre-Training? A Study with Context-Free Grammars"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2504.17562."}