{"as_of":"2026-08-21T16:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:543f0e29e2dc9e5e3f4afffe9235f4777fec2fc3d8ad4b4baa720d38e7b8f7a7","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:27:28.193940Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00418/citation-record","integrity":"/paper/2608.00418/integrity","json":"/paper/2608.00418/citation-record.json","paper":"/paper/2608.00418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.754910Z","title":"It remains to prove the gradient inequality","venue":null,"work_id":"e5157664-64af-4333-8dac-5f56a7b8fb69","year":2024},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.189935Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:5fc533d884161426695a87bfcde6e1e01e5eb1af4feafa5131ec1a531dfcc20e","observation_id":"0fdfd49a-05e7-42ae-9e30-8552cdf81269","resolution":{"observed_at":"2026-08-15T15:27:28.759504Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19985","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.598699Z","title":"Structured initialization for vision transformers.arXiv preprint arXiv:2505.19985,","venue":null,"work_id":"5477e86a-130d-4c6f-8d8c-533fcc9d9b51","year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.125676Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:6d6a3603d97f6d1c042303d1a86470f7b68e19bb6add5517b35b554adf7b081c","observation_id":"8764e350-2017-4aa2-8bb5-4297b32f3f38","resolution":{"observed_at":"2026-08-15T15:27:28.607893Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.741676Z","title":null,"venue":null,"work_id":"d6d1216f-d9d7-4954-ab81-0d17b4646156","year":2000},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.193940Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:d4d85518d995a25d28dc86b7a698054c721465df4a49273a7849370569c5acf5","observation_id":"84dc7d6b-e2af-4332-b611-ca63581213db","resolution":{"observed_at":"2026-08-15T15:27:28.746046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11161","last_updated":"2026-05-07T13:22:24Z","snapshot_observed_at":"2026-08-20T02:24:29.615253Z","submitted_at":"2026-03-11T18:00:00Z","title":"Algorithmic Task Capture, Computational Complexity, and Inductive Bias of Infinite Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11161","snapshot_observed_at":"2026-08-15T15:27:28.143731Z","title":"On the minimal degree bias in generalization on the unseen for non-boolean functions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.143731Z"},"links":{"cited_paper":"/paper/2603.11161","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:7b520b6e0bc7df61fae8da150d09ed840f8f4800016483d8a9328266ec54908c","observation_id":"5c904b94-a1bc-47d6-b81d-a5fb689638c7","resolution":{"observed_at":"2026-08-15T15:27:28.143731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18605","last_updated":"2025-05-24T08:59:28Z","snapshot_observed_at":"2026-08-19T03:00:05.603591Z","submitted_at":"2025-05-24T08:59:28Z","title":"Rethinking Causal Mask Attention for Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18605","snapshot_observed_at":"2026-08-15T15:27:28.153008Z","title":"Xiaohuan Pei, Tao Huang, YanXiang Ma, and Chang Xu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.153008Z"},"links":{"cited_paper":"/paper/2505.18605","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:c6c178705a4753f35bfa27022d5b4c3a87c6cf61fe34fb83fa649732208cee79","observation_id":"f3805a3d-df84-4147-95be-c71a45f001a4","resolution":{"observed_at":"2026-08-15T15:27:28.153008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-15T15:27:28.161667Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.161667Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:a9fc80c69ba78e925148a3b34c536e757c1dfc7fba29a04c809544bf9b44c1ad","observation_id":"7d14d403-894d-4239-81f4-e7ba3f621644","resolution":{"observed_at":"2026-08-15T15:27:28.161667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.769161Z","title":"k-means mask transformer","venue":null,"work_id":"84e8de27-426e-49da-a4b3-c28b840c0fc8","year":2022},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.165712Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:8c04a46767c659cdced6bb7caa40251caccc0d735e4e7e58935c8b368689b38a","observation_id":"083545f2-45c0-493a-866a-735402ae473a","resolution":{"observed_at":"2026-08-15T15:27:28.773440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.12180","last_updated":"2019-12-20T13:27:27Z","snapshot_observed_at":"2026-08-15T02:08:46.249033Z","submitted_at":"2019-12-20T13:27:27Z","title":"Axial Attention in Multidimensional Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.12180","snapshot_observed_at":"2026-08-15T15:27:28.169464Z","title":"ISBN 978-3-031-19818-2","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.169464Z"},"links":{"cited_paper":"/paper/1912.12180","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:93febb9f423c5b8f88f525f4b71067d79059202d1a61f69f4b67f10092028e2c","observation_id":"8e401339-a09f-46be-a0de-bec96e36cdf7","resolution":{"observed_at":"2026-08-15T15:27:28.169464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.173496Z","title":"Alex Krizhevsky","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.173496Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:9b2225e146c0f833e545e82307d70d836f44360148f95ba70989d14c00074d7c","observation_id":"2b3b554b-3fee-4d83-8420-8c817257f1ca","resolution":{"observed_at":"2026-08-15T15:27:28.173496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-20T14:47:29.320021Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-15T15:27:28.177064Z","title":"Tinystories: How small can language models be and still speak coherent english?arXiv preprint arXiv:2305.07759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.177064Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:d96d38ac883a13e95ec9e1baf9866de04f826961e938a1ff1f3752228c19d44f","observation_id":"1f87a2cb-0bf9-43d0-b72e-1e0f1b53ee10","resolution":{"observed_at":"2026-08-15T15:27:28.177064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-15T15:27:28.180997Z","title":"Pointer sentinel mixture models.arXiv preprint arXiv:1609.07843,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.180997Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:bed3518f854c35b18223311c0584980914294a1bc8a995a622eb48d130439654","observation_id":"ab8a79a0-09b0-4d8c-a339-2f60007d184c","resolution":{"observed_at":"2026-08-15T15:27:28.180997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.185033Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.185033Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:dac1594b3d3073bb22389683ba6398dec91b2f04bfa9753e51dcbe7363586b47","observation_id":"e1728329-a14a-491e-8ff9-a6be9b4b5aa0","resolution":{"observed_at":"2026-08-15T15:27:28.185033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18823","last_updated":"2023-11-30T18:58:26Z","snapshot_observed_at":"2026-08-20T09:36:48.779761Z","submitted_at":"2023-11-30T18:58:26Z","title":"Initializing Models with Larger Ones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18823","snapshot_observed_at":"2026-08-15T15:27:28.129994Z","title":"URLhttps://proceedings.mlr.press/v9/glorot10a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.129994Z"},"links":{"cited_paper":"/paper/2311.18823","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:f722bd20537b51c82e32d53e79ff0157de31ede2b97034e530d31476880ee535","observation_id":"fd16baa8-a3a4-420d-a838-68a183bb4e3d","resolution":{"observed_at":"2026-08-15T15:27:28.129994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.00345","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.687577Z","title":"Cutting the skip: Training residual-free transformers.arXiv preprint arXiv:2510.00345,","venue":null,"work_id":"c43b5da5-70bc-4b77-856b-e56afba8d265","year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.121006Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:8e3d827c9b59ddb6d60a3655f88dd660c778e47cc02a0c718f263d8d3428fb36","observation_id":"7e249704-d66a-48a9-b6f7-47cd89494bf5","resolution":{"observed_at":"2026-08-15T15:27:28.694314Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:27:28.106595Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.106595Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:de2dbc7f7c671c817ff3dd3da3ae477265826dc0f5d93372860c27bcf08b0911","observation_id":"14d97f61-fe29-40b1-adfe-547b64da66b1","resolution":{"observed_at":"2026-08-15T15:27:28.106595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-15T15:27:28.157349Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.157349Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:cc5bb8e88fd06f914adec22c739290989fc8d874901f205ae25fdcb8d084101c","observation_id":"70f27395-7d6c-4162-8eb9-d1e0b226714a","resolution":{"observed_at":"2026-08-15T15:27:28.157349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.08863","last_updated":"2017-05-02T22:43:10Z","snapshot_observed_at":"2026-08-18T07:50:35.911241Z","submitted_at":"2017-04-28T09:57:52Z","title":"On weight initialization in deep neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.08863","snapshot_observed_at":"2026-08-15T15:27:28.116107Z","title":"On weight initialization in deep neural networks.arXiv preprint arXiv:1704.08863,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.116107Z"},"links":{"cited_paper":"/paper/1704.08863","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:d1fd8b4eb6c3c5f2d282c82c6454f1652921eb1e06d16522d28762cde211a3ba","observation_id":"30c9624f-a04e-407f-900c-307ddc9ec5ef","resolution":{"observed_at":"2026-08-15T15:27:28.116107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12903","last_updated":"2024-09-20T16:22:37Z","snapshot_observed_at":"2026-08-20T10:26:58.889783Z","submitted_at":"2024-09-19T16:50:26Z","title":"Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12903","snapshot_observed_at":"2026-08-15T15:27:28.134413Z","title":"Scaling smart: Accelerating large language model pre-training with small model initialization.arXiv preprint arXiv:2409.12903,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.134413Z"},"links":{"cited_paper":"/paper/2409.12903","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:7023b8c8ce15f95c30050fd94af8bd861f3b428a4c6cbb5544ef264b6dfef792","observation_id":"af3f302e-8d90-4f2a-add0-2eac770f3174","resolution":{"observed_at":"2026-08-15T15:27:28.134413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09299","last_updated":"2023-12-14T19:08:56Z","snapshot_observed_at":"2026-08-16T14:34:37.658133Z","submitted_at":"2023-12-14T19:08:56Z","title":"Weight subcloning: direct initialization of transformers using larger pretrained ones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09299","snapshot_observed_at":"2026-08-15T15:27:28.138917Z","title":"Weight subcloning: direct initialization of transformers using larger pretrained ones.arXiv preprint arXiv:2312.09299,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.138917Z"},"links":{"cited_paper":"/paper/2312.09299","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:ce5fc5f456cb97c8082dec79a759f44be7ae528906002921e60602b85979097e","observation_id":"b4230f5a-34a3-4873-8949-d6fc254c08c9","resolution":{"observed_at":"2026-08-15T15:27:28.138917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T15:27:28.111257Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.111257Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:58a2419885701f1731b3fbbcc5b1ac3d37f3a29e6adead6106cba206f2e22288","observation_id":"8c4228db-04ef-413d-8eaf-0e5e43a801eb","resolution":{"observed_at":"2026-08-15T15:27:28.111257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:27:28.149074Z","title":"Jianqiao Zheng, Xueqian Li, and Simon Lucey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T15:27:28.149074Z"},"links":{"citing_paper":"/paper/2608.00418"},"observation_digest":"sha256:daf73e35f72ef0fc88c430970ed8d61560ae24dc51ba1ba679c6556ff6fd7e39","observation_id":"d54667f4-4535-4809-a428-b5e0e15eebcf","resolution":{"observed_at":"2026-08-15T15:27:28.149074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00418","last_updated":"2026-08-01T03:39:57Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-21T13:43:13.716608Z","submitted_at":"2026-08-01T03:39:57Z","title":"Mask-Based Priors Are More Persistent than Query-Key Initializations"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.00418."}