{"as_of":"2026-08-08T05:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d4250293f91f7ed0208f198536c626467c9d94952f1daf5001771c28abddcca","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:54.867626Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15773/citation-record","integrity":"/paper/2507.15773/integrity","json":"/paper/2507.15773/citation-record.json","paper":"/paper/2507.15773"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:54.759976Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.759976Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:c4fa91fef46433d332fca893c75dc20ee60be5685250d0dfefc9492fd097a79f","observation_id":"873e7234-a520-4a73-b01c-7b87849f185a","resolution":{"observed_at":"2026-08-06T15:29:54.759976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:54.764915Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.764915Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:44d6a2c0127416ea5c1c3a5fcb6a443f666ca126c2c929db5c0d6c045a1c1e23","observation_id":"91e15f32-f3eb-482a-bfb4-baa52963afdf","resolution":{"observed_at":"2026-08-06T15:29:54.764915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T15:29:54.769768Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.769768Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:a468e48d1bd91bbf4900718cfcdd3211d81a7eeb8eb9ef8dd5a827a97ca51411","observation_id":"134bb493-ef2b-4749-9a81-67f508589e2a","resolution":{"observed_at":"2026-08-06T15:29:54.769768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-06T15:29:54.775014Z","title":"Roformer: Enhancedtransformer with rotary position embedding.arXiv preprint arXiv:2104.09864 , 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.775014Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:0e945e8583041a7958f5b86ee595f48354d093853d0ce181a59c13aad1520b66","observation_id":"035b3f49-bd53-4177-9e9f-d631df31a567","resolution":{"observed_at":"2026-08-06T15:29:54.775014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-06T15:29:54.781560Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.781560Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:68dabcedb77746c2ec9352b5c46aedb4e5807fca15fcecbcefb64a6e4f3a7b05","observation_id":"81d75129-1e8e-43d0-aa96-c1c6ad580f70","resolution":{"observed_at":"2026-08-06T15:29:54.781560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-06T15:29:54.787144Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.787144Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:70fdaacb85514662cf5a683ad5c27bdb20ddba565e5bc26296b58438a6dc05ae","observation_id":"d11eba53-b563-4566-8045-024fde1b974e","resolution":{"observed_at":"2026-08-06T15:29:54.787144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-06T15:29:54.792837Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.792837Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:a8899a194a4a2b2f1e00ead3a94c13dd7adfc8bdc0523dd2374ed1196a321b24","observation_id":"336e5187-496b-4861-b556-f88c7814ee84","resolution":{"observed_at":"2026-08-06T15:29:54.792837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T15:29:54.797836Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.797836Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:c1afdb0a700424879233c2c6bbe1ca64a8c8d3f15c055f0d24d4374f01114469","observation_id":"1341b25f-ce54-429d-8299-968cc77b1380","resolution":{"observed_at":"2026-08-06T15:29:54.797836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:54.802741Z","title":"Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.802741Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:44d7ecdba7c51124a74426d4ac5acce21e4fec2ec4d4ee78c7d3648f717106a7","observation_id":"60b43304-a96b-4fc6-9500-85abdb6a70c4","resolution":{"observed_at":"2026-08-06T15:29:54.802741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.182355Z","title":"Language modeling with gated convolutional networks.International Conference on Machine Learning , pages 933–941, 2017","venue":null,"work_id":"bd4f4a84-2059-45a6-943b-f5583c91f3f8","year":2017},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.807155Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:28244b76e787b3fb9f2848faf4a3ba44e214c795cac68b330bf03816ed8131a0","observation_id":"20b91860-2f11-494c-9ab1-377d2724ef77","resolution":{"observed_at":"2026-08-06T15:29:55.187464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-06T15:29:54.812397Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202 , 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.812397Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:d455507c5b9588f177b2c2cf63a35ba5b065694ec1e68c7f26fa098b39a0316e","observation_id":"a1dad2b3-adf3-42c5-b285-c1e26204d926","resolution":{"observed_at":"2026-08-06T15:29:54.812397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-06T15:29:54.817370Z","title":"Palm: Scaling language modeling with pathways.arXiv preprint arXiv:2204.02311 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.817370Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:dc5e63c22529fc443faba8e603fefad218bee331ca9dc228c5b801ba221ce595","observation_id":"212bc820-8b48-4381-919b-7ef2f9913709","resolution":{"observed_at":"2026-08-06T15:29:54.817370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.165688Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":"8f664389-4a97-442e-a8ba-600069bf97a5","year":2016},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.822681Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:77abab11459f794c92773a4eafda33d330e435f932ce581d01d3da986ae33514","observation_id":"a2aa7d57-4fc9-4169-971a-822793485027","resolution":{"observed_at":"2026-08-06T15:29:55.170604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.149972Z","title":"Byte pair encoding is suboptimal for language model pre- training","venue":null,"work_id":"e98d4bae-7bfa-484b-a22b-9003fbcbda8f","year":2020},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.827752Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:9dbfbd0cddc1cdae5e1d14dda843995762045be97df9938429bdc8e1393689c9","observation_id":"a12f0412-698e-4ae9-8ab8-436d5878f182","resolution":{"observed_at":"2026-08-06T15:29:55.155427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.134046Z","title":null,"venue":null,"work_id":"c7dfeabd-9d8c-4e94-a8a8-ebdc68eafcd4","year":2018},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.832350Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:95375e1e11a072a4eb3d19a2097414e6d4c2c947d4cf7bbd1359161ecacc523b","observation_id":"34d8732a-d737-4ae6-b7e8-a280f3e7dabb","resolution":{"observed_at":"2026-08-06T15:29:55.139297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T15:29:54.837022Z","title":"Textbooks are all you need.arXiv preprint arXiv:2306.11644 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.837022Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:6ddbf0516ebffc0cefa8fb1a494950efc63132282efb144066065c0e69134a8b","observation_id":"3275c2c9-fecb-43dc-9e70-da1cf701be01","resolution":{"observed_at":"2026-08-06T15:29:54.837022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-07-06T17:36:27.931373Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-06T15:29:54.841438Z","title":"Stable lm 2 1.6b: Improving upon our previous language model with significantly improved training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.841438Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:376096c07f4cac2a11707021f445ae875baa237f141945051a9e83e209bfb992","observation_id":"02c786c9-768c-49f1-a0b8-4b6e3057179d","resolution":{"observed_at":"2026-08-06T15:29:54.841438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T15:29:54.846247Z","title":"Gemma: Open models based on gemini research and technology.arXiv preprint arXiv:2403.08295 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.846247Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:6c3426d41c7b0e036c4e79324dbf1bf6bde9e4400e39a7ab2a21ffcfa0562abc","observation_id":"2d00e7bc-1714-42b2-8332-69ea21f8da41","resolution":{"observed_at":"2026-08-06T15:29:54.846247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T15:29:54.851185Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.851185Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:e5e859739a7713bebad3ec4ed307a755e4ddea98a235dd36802f4030ad4b6fd7","observation_id":"5df4b5fa-9275-4f5e-aa9b-b4a14bf91e39","resolution":{"observed_at":"2026-08-06T15:29:54.851185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T15:29:54.856404Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.856404Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:31b00353e6b2710a45708019027dad50a1f4b6119ee36dd6ea41b4eb70ac6563","observation_id":"09a9d5ea-e062-4abe-9e1b-5504efcc3ee2","resolution":{"observed_at":"2026-08-06T15:29:54.856404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-07-06T15:33:27.761070Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16264","snapshot_observed_at":"2026-08-06T15:29:54.862049Z","title":"Scaling data- constrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.862049Z"},"links":{"cited_paper":"/paper/2305.16264","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:27c8db9f087fef58601abfcb2f996cf8472945a1a4238cffc597eff37ab520da","observation_id":"9ed90807-a9b7-4aef-880f-a1eb6ab2360b","resolution":{"observed_at":"2026-08-06T15:29:54.862049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:29:54.867626Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.867626Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:f3f05eca53bb0e490e2a676a3bd1debbe60f79c66267fe783a612f79fd6efd21","observation_id":"ad5398d7-1a52-4244-bdf8-a35b0ecc6dd3","resolution":{"observed_at":"2026-08-06T15:29:54.867626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T15:21:27.574777Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.15773."}