{"as_of":"2026-08-18T19:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddf9cb61768e2f913e3f597d3b504b95086aefed997eb08ebb9b4ea85685dadb","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:33:12.159400Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T03:20:09.365073Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:36:55.220997Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"cited_work":{"arxiv_id":"2504.18048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.18048","snapshot_observed_at":"2026-07-02T11:36:55.220997Z","title":"Chen and D","venue":null,"work_id":"3af97948-f1ae-49c3-9997-59ce3315242b","year":2025},"citing_paper":{"arxiv_id":"2606.05957","last_updated":"2026-06-04T09:54:08Z","snapshot_observed_at":"2026-08-14T05:17:37.167621Z","submitted_at":"2026-06-04T09:54:08Z","title":"Dead Directions: Geometric Singular Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T03:20:09.365073Z"},"links":{"cited_paper":"/paper/2504.18048","citing_paper":"/paper/2606.05957"},"observation_digest":"sha256:34d27dcaacff1acf1ef71ecae0fa48702d12faaef5a3fa237edb6d0b0ddbb481","observation_id":"f6d89fe1-a61e-4a24-a6e0-5246df231ae0","resolution":{"observed_at":"2026-07-02T11:36:55.222304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18048/citation-record","integrity":"/paper/2504.18048/integrity","json":"/paper/2504.18048/citation-record.json","paper":"/paper/2504.18048"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:11.811733Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.811733Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:d5b0a18f3d3a8abb8409042eb1d09a1c2a28257195ba9ad4de4864d7a5d0a29d","observation_id":"d92e35cd-fb06-434a-8273-68cf4f8cccd7","resolution":{"observed_at":"2026-08-16T10:33:11.811733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:11.817359Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.817359Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:2d3989f74a51da863d926aa574dc184390a1a1817e532e5bc602de4945a8b364","observation_id":"f4c64661-19a2-4c48-9734-95009f4c3a67","resolution":{"observed_at":"2026-08-16T10:33:11.817359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:11.822271Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.822271Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:bd3afd5e655d4087c91bc6f2149339473124ffd7f2fe6b210fd8cb3238256316","observation_id":"6469293d-ef52-47b5-8aff-4a01b33d4b5d","resolution":{"observed_at":"2026-08-16T10:33:11.822271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.153981Z","title":null,"venue":null,"work_id":"0bae7123-ad61-4f8f-9d03-9de9aeeed6d5","year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.827725Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:85f044f27afa8ecddfd1ffb3829b44801477ff6f201ea059f2343c96a634fca3","observation_id":"6bcc1f58-ce34-4794-9aff-4e07309cf70a","resolution":{"observed_at":"2026-08-16T10:33:13.158819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.138917Z","title":"Information Geometry and Its Applications: Convex Function and Dually Flat Manifold, pp.\\ 75--102","venue":null,"work_id":"33cd6b19-d6e3-4eaf-83d9-2da2e8dbf532","year":2009},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.833447Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:50493c5aae458b368f3ed2929a62f74765bcb5d32ab7b112f1b1b7a3fdaa6e01","observation_id":"c3085bfa-0b6b-45d8-936c-0c78101626a6","resolution":{"observed_at":"2026-08-16T10:33:13.143548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.127164Z","title":"Information Geometry and its Applications","venue":null,"work_id":"498adf4e-ae01-4f40-9ed2-529488ba78e6","year":2016},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.837993Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:a876504bb30813e31543ca0329fc9619017e9b9bfbddfd374a1caa4cd9b25afc","observation_id":"972aaec8-b4e5-43a5-8b58-c2454a68f130","resolution":{"observed_at":"2026-08-16T10:33:13.130981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.113561Z","title":"M., and Telgarsky, M","venue":null,"work_id":"dc4fae3f-0cc2-460d-ae4f-4c98b0976b74","year":2012},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.842766Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:d4fd9e45144e27f276f1cc8fe354988088d2e0613ed939d4e89d49f78bbd94a7","observation_id":"a731ba1a-09f6-4d2a-8e27-242054f961c6","resolution":{"observed_at":"2026-08-16T10:33:13.117894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.099026Z","title":"J., Kakade, S","venue":null,"work_id":"f7455a89-9757-4271-aeb7-6d608a7204d8","year":2014},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.849194Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:0eca9b2991e94ca9e267535cb7b5cd3640571783a7b2e2dec17d8b00420accbd","observation_id":"b3df7d72-03c6-42ef-af97-824bd8e8e2f2","resolution":{"observed_at":"2026-08-16T10:33:13.103764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.085452Z","title":"Consideration on the learning efficiency of multiple-layered neural networks with linear units","venue":null,"work_id":"06122a85-0d57-4c39-8917-6b9a3b99d738","year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.856308Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:ff0a9057b4c51ba19e4600197a47259619b4f47ae4e745ffcb0aab06edf5565b","observation_id":"af7a6e33-780e-4bc0-805b-df03798041eb","resolution":{"observed_at":"2026-08-16T10:33:13.090259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.070602Z","title":"Studying S mall L anguage M odels with S usceptibilities, 2025","venue":null,"work_id":"06786b72-19a3-4979-881d-7ff6cb66c1f9","year":2025},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.862040Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:b477e3d80dbd7bde5ca5fb87cf78781b8f181fdded1612bde87be3a287875084","observation_id":"a67b90cc-2896-4be8-8392-0067d089ca7a","resolution":{"observed_at":"2026-08-16T10:33:13.076162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.054834Z","title":"S., Lepage, G., Svetitsky, B., and Wilson, K","venue":null,"work_id":"a02876e5-dddb-4101-85d8-c23ac978b7cf","year":1985},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.868029Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:8317340dd04e24de58c916f42b330c3489f0c4755f7a5609ebabd26125f9410b","observation_id":"54be1dd2-3e88-43fc-bdd0-c7a467275f3f","resolution":{"observed_at":"2026-08-16T10:33:13.060411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.036728Z","title":"A neural probabilistic language model","venue":null,"work_id":"df879733-6aca-49c4-ad63-ad44a49a5fc2","year":2003},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.872827Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:31708150f90201c97800af8355dde2e576dc796083b838f2336a3d032a3b2d92","observation_id":"96ee4ef0-48a4-40a3-9db5-8ab979ed7fed","resolution":{"observed_at":"2026-08-16T10:33:13.044241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:11.877477Z","title":"G., Bradley, H., O’Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.877477Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:6570c83cff61630ac312fcea74790b0784f66c97e314d6932403d6106881dec9","observation_id":"b6bca39e-f11b-4072-812d-a9b7fae83665","resolution":{"observed_at":"2026-08-16T10:33:11.877477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-16T10:33:11.881629Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.881629Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:cb32c3a4988828cc26fd23412950fd2ea16125e0f886fb53fecbbe5323db9fa7","observation_id":"514ec400-5ce2-494d-be29-bafcf0b1f7a9","resolution":{"observed_at":"2026-08-16T10:33:11.881629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:13.009011Z","title":"E ckart- Y oung","venue":null,"work_id":"d47f5187-156f-40f9-b91f-630a153af4ea","year":1970},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.886824Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:240e9a4593c552af01b78898d37d5c82bc3d630d5875b82d6ab070e6b8e0f440","observation_id":"bb832b0c-6cbd-463a-84ff-317c57640c72","resolution":{"observed_at":"2026-08-16T10:33:13.014044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17745","last_updated":"2025-01-31T12:45:13Z","snapshot_observed_at":"2026-08-16T12:58:19.391089Z","submitted_at":"2025-01-29T16:32:14Z","title":"Dynamics of Transient Structure in In-Context Linear Regression Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17745","snapshot_observed_at":"2026-08-16T10:33:11.891153Z","title":"Dynamics of transient structure in in-context linear regression transformers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.891153Z"},"links":{"cited_paper":"/paper/2501.17745","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:2dad1e4ca527884de52ca6af73a8d3585a77321a8ba0d25a972f0bf0e975f96a","observation_id":"3d5d467c-a046-45c6-b7cb-574bb11beef5","resolution":{"observed_at":"2026-08-16T10:33:11.891153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06301","last_updated":"2023-10-10T04:26:04Z","snapshot_observed_at":"2026-08-16T14:53:36.081402Z","submitted_at":"2023-10-10T04:26:04Z","title":"Dynamical versus Bayesian Phase Transitions in a Toy Model of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06301","snapshot_observed_at":"2026-08-16T10:33:11.896043Z","title":"Dynamical versus Bayesian phase transitions in a toy model of superposition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.896043Z"},"links":{"cited_paper":"/paper/2310.06301","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:aa9fadf69e2122f6d0981b0af2fe6582271cddf4cb879d7424360a4bbff656e3","observation_id":"a0b752ac-27bf-4663-8407-096f564e322b","resolution":{"observed_at":"2026-08-16T10:33:11.896043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.991157Z","title":null,"venue":null,"work_id":"1557cacd-5638-4842-be96-d33353844110","year":2006},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.901440Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:8f6ca1755c61a050a8f8de3a59521c03997e147f0e00b6ce7ee12c37d8436bec","observation_id":"a431e4d3-edbe-43b0-ae08-bce069555b36","resolution":{"observed_at":"2026-08-16T10:33:12.996492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.978219Z","title":"and Weber, M","venue":null,"work_id":"3510395d-1582-418e-96c8-0004f1ba549f","year":2005},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.906004Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:84f768d7ab424755418b94044e38bcde757ab0fba6fb0ead799d3a5dd5a69270","observation_id":"e3722ff6-19f8-4d56-9c22-672a1a6ea2c1","resolution":{"observed_at":"2026-08-16T10:33:12.982062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.965789Z","title":"Identification of almost invariant aggregates in reversible nearly uncoupled M arkov chains","venue":null,"work_id":"d2b272f6-5a56-4763-bdc2-228e7b3ee4ab","year":2000},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.910364Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:c77dffbff0a2180298b762ab2bfa551f88dbeaf6816b99b55121df5c8275b9c6","observation_id":"49ea1f77-8473-465f-926a-78469a518172","resolution":{"observed_at":"2026-08-16T10:33:12.970356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.953059Z","title":"Monology/pile-uncopyrighted","venue":null,"work_id":"d239fb9e-14b8-49aa-be5e-7df85cc075d8","year":2025},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.914474Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:69c87eeeb857e79c3151987e0ba4ebf400fa8729d888fe3cf8707d0bb8ebd25c","observation_id":"d36d0323-643a-4a80-90f7-07c5432f109a","resolution":{"observed_at":"2026-08-16T10:33:12.957384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.938346Z","title":null,"venue":null,"work_id":"7318c812-f109-4933-9322-128406a2b520","year":2014},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.918547Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:b50376dcba49410f73b32ef8fba5b23b97a2ec553fc7ebcdf561dd90ee8d6695","observation_id":"fad09e10-2c10-480d-bacf-213619f63e97","resolution":{"observed_at":"2026-08-16T10:33:12.943225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.923902Z","title":"and Vidal, G","venue":null,"work_id":"fec06794-e8e5-4077-868b-7e7af38e663e","year":2015},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.924055Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:cf779d83003840fe38bcd6991d7b6f4cfc85a9689665851e836ea60fe20c6d8d","observation_id":"63c358eb-19bf-4edf-a068-4d3019951677","resolution":{"observed_at":"2026-08-16T10:33:12.928400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.907802Z","title":"HLAT : H igh-quality large language model pre-trained on AWS T rainium","venue":null,"work_id":"07230e0d-a5d1-48b5-af3f-40aaf041039f","year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.928117Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:4e1fb9dc96d7fd508f76ef12cc66f6abbcb842c8f14fc84d09f6b888623132e6","observation_id":"bc5e532e-a957-4939-a648-22657f966834","resolution":{"observed_at":"2026-08-16T10:33:12.911925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.893652Z","title":null,"venue":null,"work_id":"0208d7c1-d077-4fbb-a488-a770859cdbd3","year":1930},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.932104Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:f2587ffd83b488f63c53220be7ee80a3fab10a09445c99d915612b6a913f3596","observation_id":"e9f71d6e-e238-41e3-a4a2-d97583175250","resolution":{"observed_at":"2026-08-16T10:33:12.898968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.878649Z","title":"An SVD approach to identifying meta-stable states of M arkov chains","venue":null,"work_id":"61a357a4-e5b9-4f49-bdc2-83a04fa83ba0","year":2007},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.936150Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:0831716d6662608d6fc71873e3a58e45800cc421841a5c59e8c8eea801a115a0","observation_id":"c212e2c1-74ef-49ae-a6e1-ead74f99c502","resolution":{"observed_at":"2026-08-16T10:33:12.883121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T10:33:11.940694Z","title":"The Pile: an 800GB dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.940694Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:baef27a0111711fd28f2c4ae3480e359a2416582f7406c462c546cb2e157acc2","observation_id":"71b4d577-90a3-4926-ab4e-c1aba30b303e","resolution":{"observed_at":"2026-08-16T10:33:11.940694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.860867Z","title":"C., Petrov, T., Kubin, G., and Koeppl, H","venue":null,"work_id":"2b4b36a1-d630-4aa9-83ec-745f2f99b6e1","year":2014},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.944954Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:6d158bf393918878902c526d2eb535c669f02a2ab3edcf1099789e90fa230f8a","observation_id":"cae0c1fe-70d5-486b-a841-1fe3956f79c4","resolution":{"observed_at":"2026-08-16T10:33:12.865824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.846463Z","title":null,"venue":null,"work_id":"12bb18bf-2380-4ef2-bea8-8b034f178e6f","year":1954},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.948877Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:cf3cb73e02aa155dd823421ec59067bfa81c31840d8ad0b360dd8120c3b74ca3","observation_id":"5fdb3636-8f52-457f-94b2-13b6b3b6faad","resolution":{"observed_at":"2026-08-16T10:33:12.850353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.832214Z","title":"explanatory","venue":null,"work_id":"dfa8745a-a49a-4591-9b35-233dd936472e","year":1970},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.953153Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:c80d3070bd36a899028ea189f2c949de55b90091b28a8baab6d819d3f8e99865","observation_id":"d80734c6-563b-4dfd-bbed-bd19dcd36753","resolution":{"observed_at":"2026-08-16T10:33:12.836064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02364","last_updated":"2025-08-01T09:20:40Z","snapshot_observed_at":"2026-08-16T14:21:46.708146Z","submitted_at":"2024-02-04T06:23:05Z","title":"Loss Landscape Degeneracy and Stagewise Development in Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02364","snapshot_observed_at":"2026-08-16T10:33:11.957309Z","title":"The developmental landscape of in-context learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.957309Z"},"links":{"cited_paper":"/paper/2402.02364","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:3b7825911999f10258d65483fa77716db514089f38920c536af697a9a1997524","observation_id":"feea4f25-f3f3-4538-90f3-366172ff3e67","resolution":{"observed_at":"2026-08-16T10:33:11.957309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.813900Z","title":"M., and Zhang, T","venue":null,"work_id":"20a5dde4-f510-426d-8041-8d192863bbab","year":2012},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.962813Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:78a2ee8368fcb8500a7352dea890456fbc88b7d50ea135231c79d9ccff23997a","observation_id":"3611f6ee-a82e-4a11-b7d4-b68b9fed0e02","resolution":{"observed_at":"2026-08-16T10:33:12.819561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.798767Z","title":"Universal artificial intelligence: Sequential decisions based on algorithmic probability","venue":null,"work_id":"f03d6242-4f03-488b-ac21-7dd0cde27670","year":2005},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.968213Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:e3b5e62f480d30d7505341ba067bcfd0e9615993eba9c9793a3efa1cb6783ced","observation_id":"4c0d74c0-ac6e-45b7-bb1c-76f1a8f39788","resolution":{"observed_at":"2026-08-16T10:33:12.803846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.784762Z","title":null,"venue":null,"work_id":"9a17daf0-1bea-4d53-9fc6-7eae899d98ee","year":2016},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.973460Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:65e3c6b5955af96773716b245a57e225b48c4b5d428b54f090a4bd6fdbf06cc3","observation_id":"920f3cec-bcb7-44c6-8f97-90f04e96415a","resolution":{"observed_at":"2026-08-16T10:33:12.788546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:11.978034Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.978034Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:f1e629b9f513bfa4b0ca39c3c9978a36a63bc0d0815a6ae2b3e3ce7b792ae309","observation_id":"dbf92479-788d-440b-a118-774acaa52a0f","resolution":{"observed_at":"2026-08-16T10:33:11.978034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-16T10:33:11.983870Z","title":"and Richardson, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.983870Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:53c79f797cb6f70d832973ad0be9ea4f98e9b502b828f6537a828d79d0835418","observation_id":"907bfec4-ca86-4d9b-a0a7-bd7cf43285c0","resolution":{"observed_at":"2026-08-16T10:33:11.983870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12108","last_updated":"2024-09-30T23:30:37Z","snapshot_observed_at":"2026-08-16T15:06:23.480867Z","submitted_at":"2023-08-23T12:55:41Z","title":"The Local Learning Coefficient: A Singularity-Aware Complexity Measure","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12108","snapshot_observed_at":"2026-08-16T10:33:11.989480Z","title":"The local learning coefficient: A singularity-aware complexity measure, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.989480Z"},"links":{"cited_paper":"/paper/2308.12108","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:b4fc43918773607ee7ce9e4dd00b746e75e18f7f1554a66758b227622b210bf0","observation_id":"705d1f54-78e9-4cc7-b28b-3d0ec5af961f","resolution":{"observed_at":"2026-08-16T10:33:11.989480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05475","last_updated":"2025-02-08T07:24:04Z","snapshot_observed_at":"2026-08-17T01:37:56.589704Z","submitted_at":"2025-02-08T07:24:04Z","title":"You Are What You Eat -- AI Alignment Requires Understanding How Data Shapes Structure and Generalisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05475","snapshot_observed_at":"2026-08-16T10:33:11.993624Z","title":"P., Hoogland, J., Farrugia-Roberts, M., Wei, S., Oldenziel, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.993624Z"},"links":{"cited_paper":"/paper/2502.05475","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:8e72d35c2fa846bc3bdb798acae7e5a386b2cc0b8d5bc2a6b1240ba94bf2e8e3","observation_id":"b0cf0ff7-27dd-4433-908e-f82f8e14e266","resolution":{"observed_at":"2026-08-16T10:33:11.993624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.757111Z","title":"and Nave, C","venue":null,"work_id":"a3413648-689a-4c16-bde2-b0f978a6d481","year":2007},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:11.998590Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:ce9cf1b74a7b6ec4201cf81a42300089524fbf779e91e40449407d42952e7850","observation_id":"a71a9f05-8e47-485b-832a-d46e80653476","resolution":{"observed_at":"2026-08-16T10:33:12.766460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10508","last_updated":"2021-12-20T13:04:18Z","snapshot_observed_at":"2026-08-16T17:33:18.294291Z","submitted_at":"2021-12-20T13:04:18Z","title":"Between words and characters: A Brief History of Open-Vocabulary Modeling and Tokenization in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10508","snapshot_observed_at":"2026-08-16T10:33:12.005048Z","title":"J., Alyafeai, Z., Salesky, E., Raffel, C., Dey, M., Gallé, M., Raja, A., Si, C., Lee, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.005048Z"},"links":{"cited_paper":"/paper/2112.10508","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:de0ead0c05460ffdc0e7a5d66aac7bf047ce2c97b321ea614c49457d88f13217","observation_id":"8647b6cb-89fb-4564-8cd2-00b6bddbf47c","resolution":{"observed_at":"2026-08-16T10:33:12.005048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-16T10:33:12.010780Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.010780Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:da7648926296c8f708d32e54ad5c228293eddd2c42348a9af6ff6edc83d450be","observation_id":"86c1dac7-c517-42df-8999-ca7d6324fa0b","resolution":{"observed_at":"2026-08-16T10:33:12.010780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.743396Z","title":"S., and Dean, J","venue":null,"work_id":"39179575-eb71-4316-9b6e-af1b5a903c09","year":2013},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.017955Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:21627d28508bf8a8c5ffd8ed15af174cd94ead81a5f94a5c4301ef445d809e97","observation_id":"11dd7dbe-d957-481f-ab19-8cdda0017b7d","resolution":{"observed_at":"2026-08-16T10:33:12.748106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.728500Z","title":"Pattern theory: a unifying perspective","venue":null,"work_id":"267fd8eb-4fd1-428b-8ec0-70650bdcb0ea","year":1992},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.023628Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:0ccf5555f46d2f0543bf4a344f1c800e29fbfb66e04a4adf0f48976d4878bc3b","observation_id":"cb863759-fa3a-4513-8cc8-518f4e54d9e9","resolution":{"observed_at":"2026-08-16T10:33:12.734070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02098","last_updated":"2024-11-04T14:06:49Z","snapshot_observed_at":"2026-08-16T13:03:11.094815Z","submitted_at":"2024-11-04T14:06:49Z","title":"Low-Rank Tensors for Multi-Dimensional Markov Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02098","snapshot_observed_at":"2026-08-16T10:33:12.030665Z","title":"G., and Segarra, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.030665Z"},"links":{"cited_paper":"/paper/2411.02098","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:9ea0e74a61e4b7d08db439c556990040d4ecf51cc3c4c463ece4da21a92cf54d","observation_id":"1b8cedfc-3efc-4519-89ed-03c3dcd024e2","resolution":{"observed_at":"2026-08-16T10:33:12.030665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.712728Z","title":"On the realization of hidden markov models and tensor decomposition","venue":null,"work_id":"dc8ddf9f-eebc-40cd-8120-4ac6e5547b6b","year":2021},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.036836Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:c93eddce33ccd389df0bc0870e7e7985e4037ceb1d316467c4c0d1526ae24dbb","observation_id":"b1df31e5-706f-42ce-870a-2427704df050","resolution":{"observed_at":"2026-08-16T10:33:12.718150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.699013Z","title":"and Faccioli, P","venue":null,"work_id":"09b4c9c9-bb15-400c-8cb3-e6074fcb0cb5","year":2016},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.042735Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:a0a524cb89d2dd1b7f12373b92dac890277dfad192b9321ee8b98f91bea2563b","observation_id":"90b97c50-ad97-4bff-b7b1-928652bd0833","resolution":{"observed_at":"2026-08-16T10:33:12.702961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.049529Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.049529Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:1cc18b242911ed0f439262eaa4b9aba972dea8e3c155eeb5688e65a1f68a5b61","observation_id":"152f6669-8dae-4ad1-8bf9-f4b816862476","resolution":{"observed_at":"2026-08-16T10:33:12.049529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.056104Z","title":"Future lens: Anticipating subsequent tokens from a single hidden state","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.056104Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:74316578f852e782c83558ae8a95600f42f2b7d326992c95cebbeee9ae9c8cf7","observation_id":"fb65b450-0fbd-4ec1-8151-a9bdbe22e9ac","resolution":{"observed_at":"2026-08-16T10:33:12.056104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.062179Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.062179Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:58bb0e96ffa618b056ce93759cdfe326a6a0fdf16cdab12c03e8d4f339b038a4","observation_id":"bc673fb7-2cc8-4f67-b120-e2cff921d11a","resolution":{"observed_at":"2026-08-16T10:33:12.062179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09238","last_updated":"2022-07-19T12:49:02Z","snapshot_observed_at":"2026-08-16T16:44:52.195403Z","submitted_at":"2022-07-19T12:49:02Z","title":"Formal Algorithms for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09238","snapshot_observed_at":"2026-08-16T10:33:12.067375Z","title":"and Hutter, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.067375Z"},"links":{"cited_paper":"/paper/2207.09238","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:2fbb569cd1f8848a57c8279d628e27990d9dec7824bac0bcfd7155b53bf2e9f4","observation_id":"c37e2503-6b74-4899-ba9b-58c1a9948ca0","resolution":{"observed_at":"2026-08-16T10:33:12.067375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.672386Z","title":"Renormalization and effective lagrangians","venue":null,"work_id":"0f1ae6f4-bf8e-434f-ba60-8a0c4825700d","year":1984},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.073659Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:9ca2b6456fb0264021f9094c16971a3c454f23bc7c3c2fa0e3a5f28480cc9262","observation_id":"40a44333-76db-480f-bca4-252ece7e929d","resolution":{"observed_at":"2026-08-16T10:33:12.676237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.659532Z","title":"and Simon, B","venue":null,"work_id":"2059ed8b-2886-4f11-be35-fec74df7cfdf","year":1980},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.078195Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:c8cc4073fb5711fc95c6cbcb57493a203e77aa21b29214bffb991e2592711548","observation_id":"9f1781f2-ff72-47a2-8ce5-a0849bbaf467","resolution":{"observed_at":"2026-08-16T10:33:12.664328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.646422Z","title":null,"venue":null,"work_id":"f78c4b6d-270c-40c7-b59c-1907b5759408","year":2004},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.084278Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:0237a5fd298ce96cbbbf347a434f72639cd651f8251be80f5b34608b840b02c2","observation_id":"e758b445-665d-48b7-8229-2af16f1c624b","resolution":{"observed_at":"2026-08-16T10:33:12.650637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.088214Z","title":"How good is your tokenizer? on the monolingual performance of multilingual language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.088214Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:0b3dc5a64038c4ab2740aa62bebb37677eca3f0c79f4400c498157648ae3e409","observation_id":"f8b2fa14-24f8-482d-8aa6-afdeee171cd8","resolution":{"observed_at":"2026-08-16T10:33:12.088214Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.632469Z","title":"and Wiskott, L","venue":null,"work_id":"4de76dd9-e20b-4681-8122-5c46f56e8bbc","year":2023},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.092165Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:4ce9ea2a2cdab2a641967a32bae3ff301e349d3381ee866e02a483e91b5842d9","observation_id":"f9c68cb7-06de-4fd3-a086-03b33af99806","resolution":{"observed_at":"2026-08-16T10:33:12.636820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.095941Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.095941Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:1598ddb80a459b0916eda01dd87ebcd43f23014ec24cfefa46b00dd8cd315bfe","observation_id":"00f6e8c7-61b1-4b42-af15-3ab21668472d","resolution":{"observed_at":"2026-08-16T10:33:12.095941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.607992Z","title":"Transformers represent belief state geometry in their residual stream","venue":null,"work_id":"9f0b5384-d3ba-4781-b20f-f354fb79fb95","year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.099814Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:1d9613095f42832c1627e45f7201de135fb3f20e36f097ffc400293e11558c28","observation_id":"3bf09b36-43ab-45ab-bcef-d6876f31918c","resolution":{"observed_at":"2026-08-16T10:33:12.612818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.103457Z","title":null,"venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.103457Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:c33b176bf1a82688d1707d074d29979b3f9eeb98a0830a47f8eb6702c6eda7a2","observation_id":"f38c413d-2c20-4e87-bdd7-1d3426be7c06","resolution":{"observed_at":"2026-08-16T10:33:12.103457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.107669Z","title":"The low-rank hypothesis of complex systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.107669Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:14568d8b15b01fe0b865890fa064c754940031f13a48cdb1fb91d0cc5d95e24b","observation_id":"c1b0d75a-4451-4633-aa87-ed21a31dba4c","resolution":{"observed_at":"2026-08-16T10:33:12.107669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.578668Z","title":null,"venue":null,"work_id":"2bae2561-5712-4951-855c-6969b05fd899","year":1966},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.111574Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:8e4e300bb840dbab1a50c3052fa35668c0cd2086d9ef220c2457555e98dd221a","observation_id":"fbb20c6e-7e47-416c-b055-ec5efc705f72","resolution":{"observed_at":"2026-08-16T10:33:12.583450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18666","last_updated":"2025-01-30T15:56:25Z","snapshot_observed_at":"2026-08-13T09:26:43.111995Z","submitted_at":"2025-01-30T15:56:25Z","title":"Structure Development in List-Sorting Transformers","version":1},"cited_work":{"arxiv_id":"2501.18666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.18666","snapshot_observed_at":"2026-08-16T10:33:12.253121Z","title":"Structure Development in List-Sorting Transformers","venue":"cs.LG","work_id":"42d7ea6a-1631-4162-b9a9-a9c3aaeba467","year":2025},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.115370Z"},"links":{"cited_paper":"/paper/2501.18666","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:fdfbc26c24a85f7ba35535a670567878749f8c56cdc375753081c3b9e4a94de1","observation_id":"317f7e51-3fcc-4935-a5f7-4719c2bc623e","resolution":{"observed_at":"2026-08-16T10:33:12.261779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.565960Z","title":null,"venue":null,"work_id":"f48839b9-2411-47ef-b64a-6dd69edbd8c9","year":1998},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.118992Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:8ee41d92e7c88b85b46261d4e2c664705d871194fc4cadb331c3308a102e4cc8","observation_id":"7ee02bc1-b53d-4aee-a951-dad049f9ec47","resolution":{"observed_at":"2026-08-16T10:33:12.570821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.553097Z","title":"The generalization phase diagram","venue":null,"work_id":"4b397706-aa2e-4c2a-9b22-05ea5714c64a","year":2025},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.122524Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:40056ee3cadb542c238c7d5a991257781a2d3f72b95ee2c497d1abf7376f151c","observation_id":"96185357-b4ec-459b-bdc7-25d40115f908","resolution":{"observed_at":"2026-08-16T10:33:12.557031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.126304Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.126304Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:17d8acaa5d1fffc96e59352c0d81aa5470579d6a0fdc0092ce75803ee2585bce","observation_id":"6f2970ae-8045-442b-acda-3671f23200d8","resolution":{"observed_at":"2026-08-16T10:33:12.126304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02984","last_updated":"2024-10-03T20:51:02Z","snapshot_observed_at":"2026-08-16T13:12:47.482154Z","submitted_at":"2024-10-03T20:51:02Z","title":"Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02984","snapshot_observed_at":"2026-08-16T10:33:12.129954Z","title":"Differentiation and specialization of attention heads via the refined local learning coefficient, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.129954Z"},"links":{"cited_paper":"/paper/2410.02984","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:f5832723e71b5ca715bafc8216165a6a6f0a0b2d37545d62e6275ece8a40cc7c","observation_id":"a8b64832-1f11-4fd6-bcf3-701c44216dcc","resolution":{"observed_at":"2026-08-16T10:33:12.129954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.527528Z","title":"Algebraic Geometry and Statistical Learning Theory","venue":null,"work_id":"278d9b6b-0c02-4691-9156-b2b38d7bcb29","year":2009},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.134220Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:f280ab1be306527cdded03574b3f1af11fb852a4ec8a75a166fdbcaded83b637","observation_id":"44d8540d-e2f2-420d-9f6c-b32da07a1cce","resolution":{"observed_at":"2026-08-16T10:33:12.533832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.511089Z","title":"A Widely Applicable Bayesian Information Criterion","venue":null,"work_id":"ab506838-4764-404d-9abf-b9fcf415dc43","year":2013},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.138904Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:d91adcad467f342a559b86472f2e8a0a025e123b7fa0686ae614bdb047411181","observation_id":"cfbf99a8-c018-4fda-bd09-623c91961c66","resolution":{"observed_at":"2026-08-16T10:33:12.515519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.494437Z","title":"Mathematical Theory of Bayesian Statistics","venue":null,"work_id":"4e44ca52-00dd-4116-98cf-cb321530c077","year":2018},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.142749Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:0f3c60fb58c2a7c24124c49e5f0386294ef4c21649e91727a99fbface9a8cec6","observation_id":"28f2335b-36f0-4025-a774-75d16775bbad","resolution":{"observed_at":"2026-08-16T10:33:12.499330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.479753Z","title":"and Teh, Y","venue":null,"work_id":"9ef5e875-8916-44e8-86f4-ac837b5ba48a","year":2011},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.147309Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:0d56dd149748af91e1733704b8db237441deb85e8c494415c56b4d9725f3bea0","observation_id":"169650a8-4a89-4ca7-a1b2-e144b3375990","resolution":{"observed_at":"2026-08-16T10:33:12.484405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.466125Z","title":"X., and Levine, L","venue":null,"work_id":"85678a04-7b24-40d9-be33-c43e7fb4b117","year":2024},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.151248Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:a5a8d4fee8ee53833e570b93fa83f77c74c7b8571fd566fd8e7cd1327837aea6","observation_id":"5b674995-f699-4c4c-aa4f-bd27fbf446a1","resolution":{"observed_at":"2026-08-16T10:33:12.470767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.07145","last_updated":"2020-03-05T18:43:29Z","snapshot_observed_at":"2026-08-18T04:07:05.322018Z","submitted_at":"2019-12-16T00:55:34Z","title":"PyHessian: Neural Networks Through the Lens of the Hessian","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.07145","snapshot_observed_at":"2026-08-16T10:33:12.155174Z","title":"Pyhessian: Neural networks through the lens of the hessian, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.155174Z"},"links":{"cited_paper":"/paper/1912.07145","citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:8ae553555be4f413ce5d7d201f2cf7b8bb0a5eb09152f64732328dfcc4faec8b","observation_id":"6553af99-6a6b-483d-9428-f29cb7b7f38b","resolution":{"observed_at":"2026-08-16T10:33:12.155174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:33:12.453235Z","title":"and Wang, M","venue":null,"work_id":"c78e36d5-9e6a-4130-8ba2-2c5e6304824a","year":2019},"citing_paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T10:33:12.159400Z"},"links":{"citing_paper":"/paper/2504.18048"},"observation_digest":"sha256:29398cc852e5ca90fdcb14f7a737c9b1d4e07d0ae889e5655610c754e95a5da8","observation_id":"7dcbceca-75f2-46bb-ab98-3bf17c74562b","resolution":{"observed_at":"2026-08-16T10:33:12.457639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18048","last_updated":"2025-04-25T03:38:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T01:38:34.583178Z","submitted_at":"2025-04-25T03:38:10Z","title":"Modes of Sequence Models and Learning Coefficients"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2504.18048."}