{"as_of":"2026-08-10T00:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f25008facbc24de4ff713a3791f9e36789b8a88d29ad600fcf248bd5028fe813","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:16:23.996106Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09503/citation-record","integrity":"/paper/2502.09503/integrity","json":"/paper/2502.09503/citation-record.json","paper":"/paper/2502.09503"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T21:16:23.841412Z","title":"Attention Is All You Need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.841412Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:1ce01c2cefa378e8beaeb90ed906c2a9535b58345d73ffa31283c0ef97a0fbbe","observation_id":"a7c903d0-88b4-49ab-bb9b-71c93de71f13","resolution":{"observed_at":"2026-08-07T21:16:23.841412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s43681-024-00435-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.244144Z","title":"Exploring ChatGPT and its impact on society,","venue":null,"work_id":"af339fea-714a-4fc1-b94d-47131b06cfa3","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.846097Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:ed231edfdfc69af832854f8db488ffc1d2bd2d5d4dd706ffb03a6c8b755c822b","observation_id":"be2c4fc7-d896-4238-94be-86553b5877ae","resolution":{"observed_at":"2026-08-07T21:16:24.248893Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.850026Z","title":"Long Short-Term Memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.850026Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:52b2b979c1750547ead1460eee5397ffa531cc0bd5c24466c3a57fd8ff4623cb","observation_id":"1477fe55-62db-40d3-b771-26d7aa9e2253","resolution":{"observed_at":"2026-08-07T21:16:23.850026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.854008Z","title":"Transformers in the Real World: A Survey on NLP Applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.854008Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:42d5707259cd63afbaece31e95ee9f13d1bdab411588de2ee2f05e526b71e448","observation_id":"48e2639d-b16b-43eb-acf8-a6839ea65116","resolution":{"observed_at":"2026-08-07T21:16:23.854008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15178","last_updated":"2024-08-27T16:22:18Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T16:22:18Z","title":"A Review of Transformer-Based Models for Computer Vision Tasks: Capturing Global Context and Spatial Relationships","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15178","snapshot_observed_at":"2026-08-07T21:16:23.858245Z","title":"A Review of Transformer-Based Models for Computer Vision Tasks: Capturing Global Context and Spatial Relationships,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.858245Z"},"links":{"cited_paper":"/paper/2408.15178","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:a0e2c6ab5969dc7fec0995f74ac524e4009238d4b79455e346395c2c3644f340","observation_id":"d1040475-88c4-42d2-b88c-532ed7d5800e","resolution":{"observed_at":"2026-08-07T21:16:23.858245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10290","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.656869Z","title":"Transformers in Healthcare: A Survey,","venue":null,"work_id":"4652d608-005e-4bbb-add3-ccc9296e90a0","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.863006Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:06899ee73dfaa98f601b0c07c658a29d3c5dcabb81c1ab788d33c0e3f7e2c883","observation_id":"a5d2b36f-b503-4804-a3f6-00fc2d1d7433","resolution":{"observed_at":"2026-08-07T21:16:24.664387Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.868559Z","title":"Transformer technology in molecular science,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.868559Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:d2ab68480a3aadca514df31616a605bf10f928225a237b757939cbef11f5c467","observation_id":"56f322a3-8e11-44b4-bb50-12c7900b0228","resolution":{"observed_at":"2026-08-07T21:16:23.868559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.873199Z","title":"Transformer Architecture and Attention Mechanisms in Genome Data Analysis: A Comprehensive Review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.873199Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:dfc8e647e861a913e3e7e87dfcdc76222b2156c84958e7bdfff6388a8fc8b1b0","observation_id":"a13bb1ab-cfa3-4754-8123-6d3f278017ed","resolution":{"observed_at":"2026-08-07T21:16:23.873199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04903","last_updated":"2020-10-10T05:03:14Z","snapshot_observed_at":"2026-07-06T10:03:10.192827Z","submitted_at":"2020-10-10T05:03:14Z","title":"What Do Position Embeddings Learn? An Empirical Study of Pre-Trained Language Model Positional Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04903","snapshot_observed_at":"2026-08-07T21:16:23.878829Z","title":"What Do Position Embeddings Learn? An Empirical Study of Pre-Trained Language Model Positional Encoding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.878829Z"},"links":{"cited_paper":"/paper/2010.04903","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:8f42baa13e51a4fb3bf90a5b9a04f23232076d591a01cea4c8e8f053ce0f6c15","observation_id":"6f06bcc8-4d3a-4688-9a06-bdb63175cfc6","resolution":{"observed_at":"2026-08-07T21:16:23.878829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T21:16:23.884912Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.884912Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:9c853d5c58270ef7001647d90a3f4b31c65d37030feddbe686636ace8dc2506a","observation_id":"ec86cbc9-646a-456f-a50c-1da7fdb0e33c","resolution":{"observed_at":"2026-08-07T21:16:23.884912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-07T21:16:23.890216Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.890216Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:c0ef1cb305d102e9a3fcfaca2ca35318bb1c12a3965582a7d7342f885999022e","observation_id":"9bd981ac-a718-4cbe-b92d-2f59c0d99f00","resolution":{"observed_at":"2026-08-07T21:16:23.890216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.895155Z","title":"Neural Architecture Search for Transformers: A Survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.895155Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:20f8bb3d88d5bbf90717590d5546bc92ea3d2ef5ad6fc8b31b666d5b54ebbd9d","observation_id":"170585b3-b345-4701-97d4-48ef25201b80","resolution":{"observed_at":"2026-08-07T21:16:23.895155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13955","last_updated":"2022-07-28T08:41:41Z","snapshot_observed_at":"2026-07-06T13:36:14.246767Z","submitted_at":"2022-07-28T08:41:41Z","title":"Neural Architecture Search on Efficient Transformers and Beyond","version":1},"cited_work":{"arxiv_id":"2207.13955","doi":"10.48550/arxiv.2207.13955","metadata_source":"pith","pith_arxiv_id":"2207.13955","snapshot_observed_at":"2026-08-08T00:16:16.039225Z","title":"Neural Architecture Search on Efficient Transformers and Beyond","venue":"cs.CL","work_id":"43172bc6-2489-4af4-9359-e6af5d57f9c5","year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.899442Z"},"links":{"cited_paper":"/paper/2207.13955","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:ea3f1cf95b232f68236f87f56c9ab7d2fa2eea37c48ecbcdc62eaa2a3ab307a2","observation_id":"107cda2f-aa03-4e18-8842-43c65e39329a","resolution":{"observed_at":"2026-08-07T21:16:24.144286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T21:16:23.904751Z","title":"HuggingFace’s Transformers: State-of-the-art Natural Language Processing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.904751Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:68816288fca783d957eb9c43b0d2ea252aa49930811a71009bee36a6ca44e322","observation_id":"a5d7cc69-6324-4ccf-ba85-57e2ae95a064","resolution":{"observed_at":"2026-08-07T21:16:23.904751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.910279Z","title":"PyTorch 2: Faster Machine Learning Through Dynamic Python Bytecode Transformation and Graph Compilation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.910279Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:3aa0b71881e15f76a7ab09de47a582b71d08d78715d32b1dc984464fc273e438","observation_id":"7c70131f-c03b-46f9-a8fd-068c9f19667f","resolution":{"observed_at":"2026-08-07T21:16:23.910279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.819295Z","title":"Transformer — PyTorch 2.6 documentation","venue":null,"work_id":"72f286ae-d190-4d21-ac79-2e4cdb9ca42b","year":2025},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.914158Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:9e40fd7449a13b1a27afccfda2613606bb64a0dc44f90397497d44707e3e457d","observation_id":"baee90fe-fb98-41fb-9cc3-d855b892c0db","resolution":{"observed_at":"2026-08-07T21:16:24.823779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.805199Z","title":"TensorFlow: Large-Scale Machine Learning on Heterogeneous Systems","venue":null,"work_id":"0103f424-2817-4082-b2e0-86a4a7a9ea4a","year":2015},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.918292Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:d6f1e2e2d9788f3bc5ac1122aaa10dcb8995c2ad46953f5dcdfdc4ddacc6be9e","observation_id":"2f3e7d39-534d-40c2-a965-c2db54ed4916","resolution":{"observed_at":"2026-08-07T21:16:24.810082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.790328Z","title":"models/official/nlp/modeling at master · tensorflow/models,","venue":null,"work_id":"63acc359-db2b-4cc2-978c-424a3cef52c5","year":null},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.922551Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:a2f685b888cd70ae669c8cdcc4935109dff22bf69d3be71bb26f40b78b6091ed","observation_id":"604ae2bb-25d1-4f78-87ef-4d8aad830bc2","resolution":{"observed_at":"2026-08-07T21:16:24.795337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.762150Z","title":"Customizing a Transformer Encoder | Text,","venue":null,"work_id":"26c392d6-bab2-41f6-972e-47e96c33710a","year":2025},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.931141Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:317502d4979bb52876615a2fb8cf97bdc5773ebe6a101fb683cecebf8b63c915","observation_id":"0b16a03c-1384-4f7b-8168-646c12729cd4","resolution":{"observed_at":"2026-08-07T21:16:24.767234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.750235Z","title":"Ousterhout, A Philosophy of Software Design, 1st ed","venue":null,"work_id":"9f4e8cb0-5613-4ac9-b887-d606c4b4640b","year":2018},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.934782Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:eeb29cdf4a8bc5d7bbd4ce22e6cad4f58910e9d6c35ee48d3bc0bfeb72fd178f","observation_id":"03121d5e-0919-4fff-b09d-60b2844a24ce","resolution":{"observed_at":"2026-08-07T21:16:24.753797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.736285Z","title":"Vogel, I","venue":null,"work_id":"1456ebbb-cd21-4593-a4ca-36b681ceebe9","year":2011},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.938080Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:a6b515beebc5438675eed4b242c28ce50290ec66f7f1a147b4340333f91a6dbc","observation_id":"92c51d2c-ae24-48fd-92c2-32dbaafa9a1d","resolution":{"observed_at":"2026-08-07T21:16:24.740843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.722223Z","title":"Gamma, R","venue":null,"work_id":"8c284a27-4039-4792-b867-0d55c3bdb418","year":1995},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.941604Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:eadde336e3a399b09f8e47715b65380216105ed10dd0e4d67c6df00a45ecb469","observation_id":"8d5f6a7a-3418-44ea-b022-a600062ad15a","resolution":{"observed_at":"2026-08-07T21:16:24.726535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07730","last_updated":"2024-03-31T21:20:30Z","snapshot_observed_at":"2026-08-08T17:54:04.911531Z","submitted_at":"2023-02-12T01:26:49Z","title":"Transformer models: an introduction and catalog","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07730","snapshot_observed_at":"2026-08-07T21:16:23.945094Z","title":"Transformer models: an introduction and catalog,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.945094Z"},"links":{"cited_paper":"/paper/2302.07730","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:7035639358efdb67b427d5cc0cdb95960f5454703b70929f8efbf060fdf0b3a5","observation_id":"ef530dd1-be08-4945-8da0-e38e9d66a056","resolution":{"observed_at":"2026-08-07T21:16:23.945094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T21:16:23.948909Z","title":"Longformer: The Long-Document Transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.948909Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:a72b44234273bf15d53c858c3be91b8d11fe74da2c62fd59ab5ccc923a0220a6","observation_id":"f0d55313-bcf2-4da0-a770-796c0e8d1bfc","resolution":{"observed_at":"2026-08-07T21:16:23.948909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14062","last_updated":"2021-01-08T07:41:50Z","snapshot_observed_at":"2026-07-06T09:42:23.296738Z","submitted_at":"2020-07-28T08:34:04Z","title":"Big Bird: Transformers for Longer Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.14062","snapshot_observed_at":"2026-08-07T21:16:23.953420Z","title":"Big Bird: Transformers for Longer Sequences,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.953420Z"},"links":{"cited_paper":"/paper/2007.14062","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:e9ace8607ad213958c91bf99c23d441f17ab3e17fcf0060790e62c5d61add3d4","observation_id":"b397da3b-45e4-45d1-9190-91316e544687","resolution":{"observed_at":"2026-08-07T21:16:23.953420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.706197Z","title":"Multi-Objective NAS with Ax — PyTorch Tutorials 2.3.0+cu121 documentation","venue":null,"work_id":"eeaddd8e-8dcb-40b4-975b-3f063f6c67c3","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.957896Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:76b3b8d0d4215d4b6a5458cb3cca58f6da4764f8fe52b064ca9c7322194c0e17","observation_id":"d691a8a2-e03f-46c8-a0d2-8e7ccd23dd1b","resolution":{"observed_at":"2026-08-07T21:16:24.711717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.689829Z","title":null,"venue":null,"work_id":"a042efed-ac06-4c91-8ae8-7669e798e52c","year":2025},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.961946Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:73e12123d8b855bff0bf42a81c1a525fb06bc5764e2daec5f6fa899fc0fc1339","observation_id":"3135ca8d-93ea-4186-9873-44aa9246d986","resolution":{"observed_at":"2026-08-07T21:16:24.694949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.966460Z","title":"Bleu: a Method for Automatic Evaluation of Machine Translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.966460Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:4aa74015b987b275dc715994aa1dd59aa12ebaed1f81be1ac1d99953ae019ad3","observation_id":"1bf265f4-29f5-4bfe-8504-040fdbfcd4b3","resolution":{"observed_at":"2026-08-07T21:16:23.966460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.970525Z","title":"Findings of the 2014 Workshop on Statistical Machine Translation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.970525Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:05126efa24b3f528afc7edd263573e3d5e8bd14b9052407d4478473f4cc564e5","observation_id":"baeb10ee-aefd-4eb5-96d0-41a7f2904a95","resolution":{"observed_at":"2026-08-07T21:16:23.970525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.974616Z","title":"Transfer learning enables predictions in network biology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.974616Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:cbae083cc4b17596ab7651b0b06dea3b31925da34051f1ca3447e13eab91ea42","observation_id":"f1871e75-2ded-4e99-a8a9-3aed688dfa7c","resolution":{"observed_at":"2026-08-07T21:16:23.974616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.675897Z","title":"The Annotated Transformer","venue":null,"work_id":"b72e4dd9-cf37-44ee-be32-d753f6f1bc30","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.978977Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:86a5e5b302da2f46e022c76f83013b31744ed958487f6edd20648b21b703e854","observation_id":"7f036fde-c48d-44e0-ae7e-4c8ff50ee1fb","resolution":{"observed_at":"2026-08-07T21:16:24.680458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.982912Z","title":"Falcon and The PyTorch Lightning team, PyTorch Lightning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.982912Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:1fbe3b089898d048c882c853b0b01ba883c3a23202d8f4d675d347991a0176fd","observation_id":"d86ed43f-8388-47f0-a250-b83367a1d105","resolution":{"observed_at":"2026-08-07T21:16:23.982912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.986855Z","title":"Self-Supervised Speech Representation Learning: A Review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.986855Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:78f6503147f88031372132412e5576897a50eddbeec28e7039ccc3d6fa3436f8","observation_id":"ab1a82ba-219a-44da-b27b-9e7bb57b7cfa","resolution":{"observed_at":"2026-08-07T21:16:23.986855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02155","last_updated":"2018-04-12T18:51:33Z","snapshot_observed_at":"2026-07-06T06:26:51.386842Z","submitted_at":"2018-03-06T13:13:11Z","title":"Self-Attention with Relative Position Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02155","snapshot_observed_at":"2026-08-07T21:16:23.991407Z","title":"Self-Attention with Relative Position Representations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.991407Z"},"links":{"cited_paper":"/paper/1803.02155","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:0b3578cf55d08ba8cb426168959c569a7a7a2fadd0f10d4ef7c83673ec9cb65c","observation_id":"d05b35df-7c56-4102-98a8-c2fdf7cef293","resolution":{"observed_at":"2026-08-07T21:16:23.991407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-07T21:16:23.996106Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.996106Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:0703d25af6775f14e6c265bba1a9c7139a5dc8a3ea58e7484fa88ca793bb7188","observation_id":"fedc2b9e-5ccf-436a-a4c1-f125cf785349","resolution":{"observed_at":"2026-08-07T21:16:23.996106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.776298Z","title":"Available: https://github.com/tensorflow/models/tree/master/official/nlp/modeling","venue":null,"work_id":"9a92eef3-1997-403e-b7de-a83e62087255","year":null},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.927058Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:21abcde55fba96b9281daa0ca546b14ffd1d2dbee398e3f7423060804fdd58c0","observation_id":"20423c3b-536c-45a6-88b0-3659935f46d5","resolution":{"observed_at":"2026-08-07T21:16:24.780824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T08:26:49.221675Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2502.09503."}