{"as_of":"2026-08-08T06:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4141c7262b2d5c414e450876b190fa61f2e4e7a615318e1424a66436b465730a","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:26:31.193173Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14095/citation-record","integrity":"/paper/2506.14095/integrity","json":"/paper/2506.14095/citation-record.json","paper":"/paper/2506.14095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.913751Z","title":"Attention is all you need","venue":null,"work_id":"abf2fea2-c56e-4539-9178-ba158090299a","year":2017},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.715156Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:8afc3a638a7165af2296d7156efffe86807d77137e4693fcf04a4f3488628ccb","observation_id":"62771866-b7fa-4835-8861-4c85f607bed9","resolution":{"observed_at":"2026-08-07T00:26:33.918906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.897605Z","title":"Are transformers universal approximators of sequence-to-sequence functions? In International Conference on Learning Representations, 2020 a","venue":null,"work_id":"444f119d-d201-4aab-bc31-09fc9ccf8ce8","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.776075Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:6b623487578538d31edb591e5e31a5e77846d19cd05fa39e3d897670da774bf1","observation_id":"22bb8517-1758-44a3-89d5-f49376359346","resolution":{"observed_at":"2026-08-07T00:26:33.902339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:30.865774Z","title":"Efficient transformers: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.865774Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:78c7a60d4079530e6786e3be6a4f0fbe3b51056d18c92182aa50765a893a6860","observation_id":"8e9223ce-1562-43b5-a3cb-18c05d591716","resolution":{"observed_at":"2026-08-07T00:26:30.865774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.883195Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":"c1e9ade0-1128-45ae-95c2-afe58a5886ae","year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.878995Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:88b6762b7d62eec358fa8849f373d3ea880e9d78f87ec17566685eaa032cc19b","observation_id":"1af2cb21-31bf-4ab7-b069-681e4b50bdc6","resolution":{"observed_at":"2026-08-07T00:26:33.887632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.869209Z","title":"Cognitive Mechanisms Associated with Auditory Sensory Gating","venue":null,"work_id":"d8ecf990-d60d-4225-bc79-9702ef633074","year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.884261Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:b46937d5151c04cf81c9176ecab460b5eccc63217aed3c2003285801c2d57dd4","observation_id":"59ba69a1-cbbe-4543-97ca-d997251586a1","resolution":{"observed_at":"2026-08-07T00:26:33.873539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.854962Z","title":"The Senses: A Comprehensive Reference","venue":null,"work_id":"d557d810-d4b3-4fa3-a14a-0df44844495c","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.888896Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:0341fbfc6ef3044de79b16004911f63e93f8690bc95ef6da8648760189d906b2","observation_id":"44f6baf5-da5e-402a-83b1-a523095912f5","resolution":{"observed_at":"2026-08-07T00:26:33.859632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"gov/1554034","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.730109Z","title":"Sensory gating deficits in schizophrenia: new results","venue":null,"work_id":"ef423059-e46c-4180-b9d4-fdeb058c49d6","year":1992},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.894305Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:ae8448b2cf29e0a12e591cdadfce8bfee5dea2f0ed4927b57f138bc44fe08e64","observation_id":"21ace225-81de-41d0-821b-fd63afaeb096","resolution":{"observed_at":"2026-08-07T00:26:31.888917Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.08568","last_updated":"2019-12-02T22:53:39Z","snapshot_observed_at":"2026-07-06T06:01:14.572891Z","submitted_at":"2017-09-25T15:59:11Z","title":"The Consciousness Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.08568","snapshot_observed_at":"2026-08-07T00:26:30.899429Z","title":"The consciousness prior, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.899429Z"},"links":{"cited_paper":"/paper/1709.08568","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:86aeceb528a393828b0d317d8c18c04656c3b71b38f89f95c978c1a14a2b57cc","observation_id":"f4952284-fd8e-4da6-b4c6-88f49606b297","resolution":{"observed_at":"2026-08-07T00:26:30.899429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.840724Z","title":"URL https://neurosymbolic.github.io/nsss2024","venue":null,"work_id":"fec3ccc5-0882-439b-99b7-a51b22dafb58","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.910069Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:b8b2dd593d96965d8c3cdead659a90c315552576beaf5c06985db0fa3278544b","observation_id":"b2232304-32ec-42e8-a934-7a304b29b1c2","resolution":{"observed_at":"2026-08-07T00:26:33.845025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-07T00:26:30.917132Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.917132Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:97c72e830957bc13dcb06251a58c2c7733d67ab94a235b7785d6cbe9bf349169","observation_id":"14e85bea-67d9-43a4-a785-ab7f32ae9204","resolution":{"observed_at":"2026-08-07T00:26:30.917132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.826609Z","title":"Neural networks and the chomsky hierarchy","venue":null,"work_id":"c019b145-0673-40df-a62f-2e05fcb98f4a","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.922213Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:c65d11ef0ff355878d2eafc28159dac5ddbeedf74505091bf754ef6c6ca906ea","observation_id":"a9fff3c4-0fbf-4b1b-a1f7-c3f9fc251544","resolution":{"observed_at":"2026-08-07T00:26:33.830872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.807253Z","title":"O(n) connections are expressive enough: Universal approximability of sparse transformers","venue":null,"work_id":"3edb232d-e4e1-4b1d-afd0-999c4ed7ce58","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.926723Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:4edbada6b8ff25eec038ca8657dec4769f3be05c67d4be33077b79d7ebc89338","observation_id":"a66a7ba5-854b-43ff-9bbe-e3ff87789bc5","resolution":{"observed_at":"2026-08-07T00:26:33.812327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.789598Z","title":"Etc: Encoding long and structured inputs in transformers","venue":null,"work_id":"b3d69ebd-f9ab-4cc3-a210-5ea31bc85530","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.931698Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:c9e629b0de5f73e0575c1f0de35002da7eacf145c1b4a57dbb5b2827b2348064","observation_id":"61af9724-2b54-4a43-8217-c53f99349493","resolution":{"observed_at":"2026-08-07T00:26:33.794142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.774041Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"c82bb40a-598d-4090-8368-48555dce7b44","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.936249Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:216e297ce45eca517a0c54fce948c58e067d3a9ff363d2c29a3268e1bc04032c","observation_id":"84ce2eca-690d-4bb7-a2aa-9ea0dff21b3f","resolution":{"observed_at":"2026-08-07T00:26:33.778932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:30.940576Z","title":"Memory-efficient transformers via top-k attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.940576Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:5f14ef33e9e00ac90b52adcd5304192e8991d7ef1d0d869126554bcc1e103e68","observation_id":"32f6bc68-148f-4bae-a696-780ff6753dc3","resolution":{"observed_at":"2026-08-07T00:26:30.940576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.759978Z","title":"ZETA : Leveraging z -order curves for efficient top- k attention","venue":null,"work_id":"46c312e1-f97d-4132-bc2f-d2a59447b1a8","year":2025},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.945255Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:a2e02dae98190394b4854095374e926c6ed9b04d990722e52087393e5c1ab223","observation_id":"2f42847e-789a-4545-ad74-dbd1c9a601cb","resolution":{"observed_at":"2026-08-07T00:26:33.764128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.746325Z","title":"Algorithmic stability and generalization performance","venue":null,"work_id":"479a425d-1996-4ac3-afc6-860ece39570a","year":2000},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.950382Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:f005ee2ab5b10af27d07b1590a6d3692bec90391c7d041bca9a85ed15b5170e0","observation_id":"672ff6cb-90c5-4c82-99a3-f10cd42cd3a6","resolution":{"observed_at":"2026-08-07T00:26:33.750849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01240","last_updated":"2016-02-07T17:06:58Z","snapshot_observed_at":"2026-08-03T13:14:36.604775Z","submitted_at":"2015-09-03T19:53:40Z","title":"Train faster, generalize better: Stability of stochastic gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01240","snapshot_observed_at":"2026-08-07T00:26:30.954810Z","title":"Train faster, generalize better: Stability of stochastic gradient descent","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.954810Z"},"links":{"cited_paper":"/paper/1509.01240","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:1149a7bff076d29eb5cfa1ee1c212b1d8a97a5b11b332fe85c8a0095d14871b5","observation_id":"8495391a-4fb7-4739-ac0c-aec66433f718","resolution":{"observed_at":"2026-08-07T00:26:30.954810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09238","last_updated":"2022-07-19T12:49:02Z","snapshot_observed_at":"2026-08-08T01:24:23.937372Z","submitted_at":"2022-07-19T12:49:02Z","title":"Formal Algorithms for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09238","snapshot_observed_at":"2026-08-07T00:26:30.960292Z","title":"Formal algorithms for transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.960292Z"},"links":{"cited_paper":"/paper/2207.09238","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:390b7f3310f34c4387c5d87de3f0832357cde75b4ad3866cc4e419313bb34725","observation_id":"9bb6606d-3f55-472b-a431-4d0742abc47c","resolution":{"observed_at":"2026-08-07T00:26:30.960292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.732540Z","title":"A survey of transformers","venue":null,"work_id":"058f6373-51df-4bcb-a84f-42c55ae904d2","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.965609Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:7ba37ed287a019d24dc9341735a832afd614a994b29c75076110207384f8a221","observation_id":"dd34a3bd-096a-4936-9e29-698e87b2df1d","resolution":{"observed_at":"2026-08-07T00:26:33.736787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.719086Z","title":"Image transformer","venue":null,"work_id":"3865674e-437e-4170-a450-7788ee559d2a","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.969645Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:32266c928b3b695c32a981da87fe77dafd2d5df11aa730b85f7432b82737608e","observation_id":"c1bfa5c9-f0c9-4ec2-9862-5b35f64ee4ca","resolution":{"observed_at":"2026-08-07T00:26:33.723660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.703415Z","title":"Blockwise self-attention for long document understanding","venue":null,"work_id":"42d27df5-5afc-4d34-a431-6d03f5bf0603","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.974200Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9899868c5c7e2f739e273578aef52749d3a968ffebd74795e215521a2ce1dcf5","observation_id":"79b46b3c-40a9-4820-be5e-130bc2e701cb","resolution":{"observed_at":"2026-08-07T00:26:33.709229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T00:26:30.979069Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.979069Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d77a2d620bc9b9cd5bfb6d49fc15314aeec8662c9651adb189ac32ad719da22e","observation_id":"f63968ca-efc8-419d-878a-ddb05d57f944","resolution":{"observed_at":"2026-08-07T00:26:30.979069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T00:26:30.983693Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.983693Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:1a9da8fce0f79f19851bb45c0a31f37994de3e9e25931d63f1eed245ac43c04a","observation_id":"067581ba-98c3-4144-b6bb-576ff06f2877","resolution":{"observed_at":"2026-08-07T00:26:30.983693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.688611Z","title":"Sparse sinkhorn attention","venue":null,"work_id":"8dc79a5b-d4d2-4e60-a0d8-a8ad6e6c5bb2","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.988852Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9bc4c9f2f2f00bac3980c0cc711b1b8be7495ace051ab806bbb2b24726f1e6ab","observation_id":"de423e8c-14cf-431b-bb13-0d340ddd288b","resolution":{"observed_at":"2026-08-07T00:26:33.693446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00353/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.350722Z","title":"Efficient content-based sparse attention with routing transformers","venue":null,"work_id":"fa180985-9dbb-453d-b8ac-3a8e2507a20e","year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.993269Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:077a3aa55197e2dff7fb3166d5163baa144f87aeec31a949f46132b6d151f7fb","observation_id":"8cee7eee-810c-4efa-84d8-49e5f85f3321","resolution":{"observed_at":"2026-08-07T00:26:31.355960Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.674180Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"7fa0fcc4-586d-4cdb-9af8-41e264e328f7","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:30.998380Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9a1478da2e26b845bbd304f60321b3b0cab5b48552ebff6dc0173fd8f12a7fb1","observation_id":"2e7434e7-0ad7-45cb-b59f-e14f2167eae9","resolution":{"observed_at":"2026-08-07T00:26:33.678445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.659125Z","title":"COGS : A compositional generalization challenge based on semantic interpretation","venue":null,"work_id":"8f563119-4be9-4de6-acb6-ff337bd9fbb9","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.003042Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:99620b77793b050775c9f3cba576f71d5500c43a6621c3feeb5067e2825e0253","observation_id":"d84cf548-c9c4-4cf2-8365-00a069fe0a17","resolution":{"observed_at":"2026-08-07T00:26:33.664182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.645282Z","title":"Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks","venue":null,"work_id":"2089e117-18e9-4384-9a5b-01a63937f53c","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.007490Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:4c0b49e2e735e305988e85ce4b1d93451c1196e3e38226237930a4137087cb9f","observation_id":"cf06c895-63e9-4ecd-978e-e546c4c82dde","resolution":{"observed_at":"2026-08-07T00:26:33.649685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.41","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.333442Z","title":"When can transformers ground and compose: Insights from compositional generalization benchmarks","venue":null,"work_id":"ad50e0a8-a48e-4522-95c9-f4cf7a6791d1","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.011682Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9407080c216d074e14538881397d948b8d657ab71cf0be4643febd45e885304c","observation_id":"47980f98-7844-48dd-9fd5-0af02175dc94","resolution":{"observed_at":"2026-08-07T00:26:31.339636Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.016326Z","title":"The devil is in the detail: Simple tricks improve systematic generalization of transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.016326Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:44576433ed41242b9d5fe6f217b994b212706ea4f9f5a6a1211a8b0953e457d1","observation_id":"3ceab004-66f3-41e6-84d4-824a19b41134","resolution":{"observed_at":"2026-08-07T00:26:31.016326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.251","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.306962Z","title":"Making transformers solve compositional tasks","venue":null,"work_id":"4ec61d5b-c414-4e19-b4c7-a44c06e73b3a","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.020431Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:eb6c0c75755d2a0eaf8e8d8a724c0962e7cb3251ee1c845022b3a5569905ddeb","observation_id":"a13d6515-33e0-4e1d-91c8-7e541b43e13d","resolution":{"observed_at":"2026-08-07T00:26:31.312207Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.505","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.290227Z","title":"Inducing transformer ' s compositional generalization ability via auxiliary sequence prediction tasks","venue":null,"work_id":"35611d00-e78d-41f1-a242-270b16439ec9","year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.025449Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d95c0621d5d124bc7ece8539b0c29ced553ba1817a755a2c53c281c68d2b9407","observation_id":"2496269a-85e9-44eb-a5db-d03f7139143a","resolution":{"observed_at":"2026-08-07T00:26:31.295252Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.631314Z","title":"a rli, Ekin Aky \\","venue":null,"work_id":"9a7128ce-535b-4364-a008-668f1d8788fe","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.029829Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:7726d503b569f2699e984ab8ea768f8d9bf592393f187e28e39cc112c3e06789","observation_id":"84412c7a-508f-461c-a335-db1b31394c91","resolution":{"observed_at":"2026-08-07T00:26:33.635646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00663/120983","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.274007Z","title":"What formal languages can transformers express? a survey","venue":null,"work_id":"52ae9c8b-1f70-4ccd-9b4a-bd67b9c4520c","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.034312Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d9aefd62f5389eab6987091686f1f5ce41a443567a558b3b5cd6a78a096ac6b1","observation_id":"f5b2bfd4-f7c9-4872-a2ad-f00fdeacdc96","resolution":{"observed_at":"2026-08-07T00:26:31.279003Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.616207Z","title":"On the ability and limitations of transformers to recognize formal languages","venue":null,"work_id":"d5322439-326f-45b4-b1e7-4b1a88d71c53","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.038652Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:3f7fa4430ac7d9576177789c20e8996df2b993b1a0257893139da61565435a4b","observation_id":"6020b2e6-aa1c-47ce-8d90-8afc314dd586","resolution":{"observed_at":"2026-08-07T00:26:33.620841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00306/43545","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.258238Z","title":"Theoretical limitations of self-attention in neural sequence models","venue":null,"work_id":"2e3aead6-c224-4a91-8558-c2e2639e6c7f","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.042758Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:19db45d8dc50345d607d475cfa8e4f02317ff85e40c02b56f5e41eb0ee3330a1","observation_id":"1604f60a-e988-4af0-8874-2c4f77626b61","resolution":{"observed_at":"2026-08-07T00:26:31.263821Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.599976Z","title":"Formal language recognition by hard attention transformers: Perspectives from circuit complexity","venue":null,"work_id":"d3642857-6987-47f7-9bc9-1ec841fc7049","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.046942Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:b140c89440b7b4667852cf5a46d9f8e80bbbbabc645f8691957e9103dfc96cd5","observation_id":"2ece83c2-9f63-418c-b1d5-c8ae82a60982","resolution":{"observed_at":"2026-08-07T00:26:33.605490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.585063Z","title":"Saturated transformers are constant-depth threshold circuits","venue":null,"work_id":"ec1e47bf-0553-4797-a6c1-37ababb9ed32","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.051326Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:050d3aa3ec4f796cc30e3e5813242b6ba3ff77eb8183925b3359430cbe4f786b","observation_id":"bb1ab5b5-9b8c-400a-b686-8b77247e18c6","resolution":{"observed_at":"2026-08-07T00:26:33.589814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.568897Z","title":"Overcoming a theoretical limitation of self-attention","venue":null,"work_id":"f81240e8-d249-4696-b3de-1e0546bead91","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.055666Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:05a0281caf920be044e97a12b796d970241b136a71031456b761235e6b15ee73","observation_id":"f3fe64ff-55f2-46e6-80d0-57bf72a7230a","resolution":{"observed_at":"2026-08-07T00:26:33.573709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.553378Z","title":"Tighter bounds on the expressivity of transformer encoders","venue":null,"work_id":"397d5a21-1549-4e69-8ca7-ec1ae6560d49","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.059942Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:71a2584e52e371ef9f6e548997da50d206202266c0fd29d999bddf33fadb2742","observation_id":"5f80651a-9042-41df-8507-c06510ced51d","resolution":{"observed_at":"2026-08-07T00:26:33.557973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.538895Z","title":"Transformers as algorithms: Generalization and stability in in-context learning","venue":null,"work_id":"0a2fb12f-da74-400a-a546-69fe9a1a947c","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.064187Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d52d4f6667038d61ad083fab40eb46a2db5dedd6db55e7e89808e7529eb55f90","observation_id":"e1a1abc0-80ea-4abc-a8b7-530e386ed594","resolution":{"observed_at":"2026-08-07T00:26:33.543429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.524804Z","title":"Transformers learn in-context by gradient descent","venue":null,"work_id":"ee5bb2fc-9887-4cca-b877-d72eac33c1d5","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.068351Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:a9f6705c2cd58bcf2417c4e0f7e8c7a5556bf6f1143cbf6c352d4dd38c7b6491","observation_id":"af5cac0e-1cef-4924-a631-3d6f7a36699f","resolution":{"observed_at":"2026-08-07T00:26:33.529452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.509429Z","title":"The emergence of clusters in self-attention dynamics","venue":null,"work_id":"2d626b52-62b5-4b45-887f-9b70a573f808","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.072620Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:62d03650a61dda9e74de4907e87330bd9783d18a41b89ef211a2db9400b6f0a1","observation_id":"bc5a2ec6-5e4e-4209-8bbe-586adb9acbe7","resolution":{"observed_at":"2026-08-07T00:26:33.514809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.490838Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"89b4c47c-75f6-477b-bd01-c56bf304819f","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.077091Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:8c66471f50a6b0edf6b300fb5569f3df4d6fafaeef7fd5135c4e1511eb0a5ae8","observation_id":"4842f956-d2c0-4cd2-bf07-6a05324354e0","resolution":{"observed_at":"2026-08-07T00:26:33.495826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.475470Z","title":"Trained transformers learn linear models in-context","venue":null,"work_id":"00f35485-8426-4a0f-85be-9747aeaf0564","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.082054Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:9c3093aa938a40e2fc5a1cec63192d9c41ef2aa5b90a06890ccb614dde7f9733","observation_id":"0676e91a-49e1-44af-9ffe-d180a49e2d1e","resolution":{"observed_at":"2026-08-07T00:26:33.480464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.458951Z","title":"Why are adaptive methods good for attention models? Advances in Neural Information Processing Systems, 33: 0 15383--15393, 2020","venue":null,"work_id":"462bcdc4-a193-4245-b047-30340affe3e9","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.086492Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:dbe6e299ef77090471fb6979ab49b0d0f8e033e4b05a8a3743dd98cd7ec7e6bb","observation_id":"f1208b8e-f112-4011-bd87-dd3159dc5249","resolution":{"observed_at":"2026-08-07T00:26:33.464242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.440949Z","title":"Toward understanding why adam converges faster than SGD for transformers","venue":null,"work_id":"1a74ad8d-35b4-4be5-b2ae-72e12203f7ef","year":2022},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.091192Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:2141a8420a22b23f0b5321ad388e70f48068e29b4447a9b2225738444d87e16e","observation_id":"da9fc738-70f8-48b4-8259-7545c05251a4","resolution":{"observed_at":"2026-08-07T00:26:33.446017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.425758Z","title":"How does adaptive optimization impact local neural network geometry? Advances in Neural Information Processing Systems, 36: 0 8305--8384, 2023","venue":null,"work_id":"640d0386-3d4c-4631-adc9-04f132b23322","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.095922Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:5cb2f01b544d6af84a9f03a7350cab0dfa3f6e8bea573ec99622e26f20015b3c","observation_id":"c9f67186-e199-4d0c-9ad6-15fa02f759f1","resolution":{"observed_at":"2026-08-07T00:26:33.431099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.410161Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":"af189c8f-4828-4909-ac9a-aad98ef1e713","year":2023},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.101370Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:461d071680967f3f752b7062a0810b0216a79af9a4434fac1842cba9cda93228","observation_id":"dbc1b7cc-1d95-47c1-85fa-4b50bf0a234a","resolution":{"observed_at":"2026-08-07T00:26:33.414833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.393990Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","venue":null,"work_id":"225fb56e-1576-4a10-93d9-e803bb6abce0","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.105944Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:2fc87342f069a18cc439913bfd95e52c9225b986b3627fa1bdfc0fee63fc8123","observation_id":"884fe00e-92a9-460e-848e-cb3bd47f188e","resolution":{"observed_at":"2026-08-07T00:26:33.399313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.377732Z","title":"On the optimization and generalization of two-layer transformers with sign gradient descent","venue":null,"work_id":"9ca4a32f-1d91-473e-a92a-39f72cd84689","year":2025},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.110777Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:aa4eb6551cba8b13544ff36240903fc39f35f51c39a0875461f491961eae1c3d","observation_id":"0b632e26-88f9-40fd-b30c-2f0591d3f489","resolution":{"observed_at":"2026-08-07T00:26:33.383165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T00:26:31.114796Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.114796Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:251daf109402f0dd44e42db32b6ea4b3453ee4467b94a9843d4f4f5fcf5fa421","observation_id":"7d1005fb-2019-4208-b0c1-d3163e3f2a97","resolution":{"observed_at":"2026-08-07T00:26:31.114796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.119039Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.119039Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:05cced4dfc7bd0c181593b1eccfdd0cb79d63d2e8e2ad84584651226aa3c9dae","observation_id":"46115e48-be86-45ce-b49a-e9ce4bdda4f9","resolution":{"observed_at":"2026-08-07T00:26:31.119039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.123158Z","title":"BERT : Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.123158Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:c1761ddb09e0f31c1b3f1afaf38b5958a871196ad040ea96f201baf51a5f1eb9","observation_id":"ee4e4e51-cd62-4925-9254-1f342c52ca72","resolution":{"observed_at":"2026-08-07T00:26:31.123158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T00:26:31.128361Z","title":"Bridging nonlinearities and stochastic regularizers with gaussian error linear units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.128361Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:78c57eba986bc3bccdb8efedfffd84fe8180aaedc5a3e24a287c52f3077f6705","observation_id":"d1ad7295-411a-42bf-9db6-42b3ff685421","resolution":{"observed_at":"2026-08-07T00:26:31.128361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-07-06T04:37:28.029641Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-07T00:26:31.133288Z","title":"Fast and accurate deep network learning by exponential linear units ( ELU s)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.133288Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:d95361d37d4d6d75f0bcf5c28cf5741f059c98e4708662686e1e0d6393f496ec","observation_id":"d521b3a9-96a1-4475-9a3a-d3942c18b279","resolution":{"observed_at":"2026-08-07T00:26:31.133288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.351104Z","title":"Listops: A diagnostic dataset for latent tree learning","venue":null,"work_id":"067e92d5-bea5-4d53-8f49-6dd3b032409e","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.141387Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:bb7617985beef68bdd7cf8d24ac7d29ffd6ceb1bf8597bf5806a34447d39f794","observation_id":"5fa87b52-75d6-4f21-b69c-f76cc01c4f8e","resolution":{"observed_at":"2026-08-07T00:26:33.356077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-07-06T08:16:16.271286Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-07T00:26:31.146060Z","title":"Mish: A self regularized non-monotonic neural activation function","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.146060Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:95db85f8fe78b4d8a24f793da53a0a90e830310e983f02e4b31a051cc7c97322","observation_id":"bfb46c1d-85a6-4889-b1b2-37873f04faca","resolution":{"observed_at":"2026-08-07T00:26:31.146060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:26:31.152690Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.152690Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:18360414d7421a98a2a1dabdcf7a00e0a6e2e2bc7c538d0247fb3b5852c86e18","observation_id":"7a944d61-2998-44b7-a34b-676ba1b45bf1","resolution":{"observed_at":"2026-08-07T00:26:31.152690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04710","last_updated":"2021-06-09T14:13:40Z","snapshot_observed_at":"2026-08-04T22:10:15.060916Z","submitted_at":"2020-06-08T16:08:38Z","title":"The Lipschitz Constant of Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04710","snapshot_observed_at":"2026-08-07T00:26:31.158224Z","title":"The lipschitz constant of self-attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.158224Z"},"links":{"cited_paper":"/paper/2006.04710","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:f329f0ae130f6348a0765482ac90d08bca8e215b221c6f43fe7ff880a1a4eb18","observation_id":"1c0085ca-f463-4103-952b-307c15eb115e","resolution":{"observed_at":"2026-08-07T00:26:31.158224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.11637","last_updated":"2019-12-25T10:59:31Z","snapshot_observed_at":"2026-07-06T08:46:56.770342Z","submitted_at":"2019-12-25T10:59:31Z","title":"Explicit Sparse Transformer: Concentrated Attention Through Explicit Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.11637","snapshot_observed_at":"2026-08-07T00:26:31.162921Z","title":"Explicit sparse transformer: Concentrated attention through explicit selection","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.162921Z"},"links":{"cited_paper":"/paper/1912.11637","citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:bf426bfbcc8fe7bfb08b186bb022ed261a0194d8689ec4986b6a29dadeaf87d3","observation_id":"12797a98-aa4b-437c-b189-96d7d2b884b1","resolution":{"observed_at":"2026-08-07T00:26:31.162921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:33.098493Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":"f1f55141-0a9b-40fa-ae53-4df420d32d02","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.168150Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:734343914e05c3d653125db17ddcacfd02822d1e5fb5abcd01f584f192af4cc6","observation_id":"37334c11-9643-4161-800f-94b4c7a6bbe5","resolution":{"observed_at":"2026-08-07T00:26:33.275494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.862297Z","title":"Never train from scratch: Fair comparison of long-sequence models requires data-driven priors","venue":null,"work_id":"766627a4-8831-4181-92ea-450d0a6ab032","year":2024},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.172682Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:f7e5f75f5ea4fc02190d84866469c160145579f4862faff5fb64159965aa6e5e","observation_id":"10878189-944f-4b9b-8f6c-9907c722def7","resolution":{"observed_at":"2026-08-07T00:26:32.980495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.730311Z","title":"Learning overparameterized neural networks via stochastic gradient descent on structured data","venue":null,"work_id":"cf571d99-dfe1-4ba7-aaaa-2bd6fbbf1df4","year":2018},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.177991Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:591a314c46796e05a0cdd169166c58132e985f80e4bd5d113a6a3eb2167c5715","observation_id":"c25273f1-6b34-4339-bc1d-998ffb03b3da","resolution":{"observed_at":"2026-08-07T00:26:32.851131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.446269Z","title":"A convergence theory for deep learning via over-parameterization","venue":null,"work_id":"002c8437-4a21-45c3-ad23-2beae30f114a","year":2019},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.182659Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:5d33629c060a1a2fa9049df1e7ec8c898915be0558b7ab92d19bf7c96160949b","observation_id":"233ed32b-ea5f-4522-944c-d2bb9ef0050c","resolution":{"observed_at":"2026-08-07T00:26:32.582899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-019-05839-6.pdf","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:31.227629Z","title":"Gradient descent optimizes over-parameterized deep relu networks","venue":null,"work_id":"235715f5-c211-4695-ae2e-58ecd7f2d8e2","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.187525Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:dfa41f5afa58f07e910b3dbce57c0ad2be1d29b319808cd4f17a41646d9244df","observation_id":"ca681d40-ef8b-457c-962c-fffe1a113051","resolution":{"observed_at":"2026-08-07T00:26:31.234860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:32.115104Z","title":"Convergence rates for the stochastic gradient descent method for non-convex objective functions","venue":null,"work_id":"70e87b7b-e23a-449a-b2c0-516ff0deb38c","year":2020},"citing_paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:26:31.193173Z"},"links":{"citing_paper":"/paper/2506.14095"},"observation_digest":"sha256:0f57c15a246f66dca28220777fcdfe83cdf71b7b1f8bee546bbd89215bc85a1f","observation_id":"aa3a87b7-a9a4-47f5-a37e-2fd076f33f5b","resolution":{"observed_at":"2026-08-07T00:26:32.280375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14095","last_updated":"2025-06-18T12:59:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:16:07.002348Z","submitted_at":"2025-06-17T01:19:28Z","title":"Transformers Learn Faster with Semantic Focus"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":7,"verified_fuzzy":42},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2506.14095."}