{"as_of":"2026-08-18T01:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e91a92dc0027804de24b98edefd66fdfefa9be60f66fe42c7be873164766f01","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:47:35.336584Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18590/citation-record","integrity":"/paper/2504.18590/integrity","json":"/paper/2504.18590/citation-record.json","paper":"/paper/2504.18590"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.860264Z","title":"Avelin and K","venue":null,"work_id":"9746d140-a269-4714-a698-e0561a107c87","year":2021},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.189309Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:86da2a32c90eecebc8a23a72862fa4139ca72aef03056ae9418072cc2f1a9fcf","observation_id":"b728c857-212f-4087-bdef-ac34a6a7c28e","resolution":{"observed_at":"2026-08-16T10:47:35.864843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11358","last_updated":"2020-10-22T00:48:24Z","snapshot_observed_at":"2026-08-16T19:11:37.695542Z","submitted_at":"2020-10-22T00:48:24Z","title":"N-ODE Transformer: A Depth-Adaptive Variant of the Transformer Using Neural Ordinary Differential Equations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11358","snapshot_observed_at":"2026-08-16T10:47:35.194923Z","title":"Baier-Reinio and H","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.194923Z"},"links":{"cited_paper":"/paper/2010.11358","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:a2700738b76d0815d2354b066c0ba39df2c302491e4dad23e96579c2012b760e","observation_id":"9d6f7dbd-ab6d-4e3e-b06c-73b6ac5c6935","resolution":{"observed_at":"2026-08-16T10:47:35.194923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.845255Z","title":"Brown, B","venue":null,"work_id":"63c1b657-7c96-44d9-95db-3f8d303c9745","year":1901},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.200292Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:601d68b51b28f3d478ff009088f9448071eeacafefda8216b55f54f062461396","observation_id":"7a400bd7-f962-48c1-9774-c890f73bfbdb","resolution":{"observed_at":"2026-08-16T10:47:35.849873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.826216Z","title":"Chang, W","venue":null,"work_id":"a6e56126-37b1-48cf-b4f9-d472867a16fa","year":2020},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.205590Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:dd4165d9d2cc5b1c82f604996459bdd69e1b109c693dbc5ed2d6be86a0ca9597","observation_id":"28bf26ff-921c-4538-9a49-1a4261f46b44","resolution":{"observed_at":"2026-08-16T10:47:35.830869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07143","last_updated":"2021-10-14T04:05:25Z","snapshot_observed_at":"2026-08-16T20:05:57.096187Z","submitted_at":"2021-10-14T04:05:25Z","title":"bert2BERT: Towards Reusable Pretrained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07143","snapshot_observed_at":"2026-08-16T10:47:35.210795Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.210795Z"},"links":{"cited_paper":"/paper/2110.07143","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:09a0dd6dd9c7f804c3bd9c6b48c654899e8e424852abd7f79b25e0efc4fda8a2","observation_id":"c26b12c7-9df5-4539-b7e7-df7cd162f1fa","resolution":{"observed_at":"2026-08-16T10:47:35.210795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07366","last_updated":"2019-12-14T02:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-06-19T17:50:12Z","title":"Neural Ordinary Differential Equations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07366","snapshot_observed_at":"2026-08-16T10:47:35.216045Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.216045Z"},"links":{"cited_paper":"/paper/1806.07366","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:367fa0becb1363ecd40d24038f218000eb93bb607daf783d89fbebf9ada57d92","observation_id":"f457159a-da31-4971-a761-283c595066ab","resolution":{"observed_at":"2026-08-16T10:47:35.216045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05641","last_updated":"2016-04-23T23:14:39Z","snapshot_observed_at":"2026-08-15T13:55:21.008245Z","submitted_at":"2015-11-18T02:09:20Z","title":"Net2Net: Accelerating Learning via Knowledge Transfer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05641","snapshot_observed_at":"2026-08-16T10:47:35.221598Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.221598Z"},"links":{"cited_paper":"/paper/1511.05641","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:d2847c7839e3d5666e626782267f2913d53f04a674b61e88b9a88db9d1de163e","observation_id":"4707cc99-010e-4f24-b773-94edf14dc961","resolution":{"observed_at":"2026-08-16T10:47:35.221598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.810640Z","title":null,"venue":null,"work_id":"a20c4a52-baf5-4b8d-94cb-14f7bea6d98f","year":2023},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.226671Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:9b75232cd48a0be3a928bc70f636e25e0b190216c39bfc5b3336f871910fcf21","observation_id":"c0a3eff5-2460-4d3e-a662-09cdeec8b0ad","resolution":{"observed_at":"2026-08-16T10:47:35.815550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T10:47:35.231248Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.231248Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:7640fc8af22ff355b8779b071636a3eefba7e3ed415a7881dca9610414558463","observation_id":"505345ce-d9bd-4783-974c-c3be0b8802be","resolution":{"observed_at":"2026-08-16T10:47:35.231248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.794873Z","title":"Gaedke-Merzhäuser, A","venue":null,"work_id":"c9443738-0c9b-4447-9602-9ebfbfbde004","year":2021},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.236367Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:80db5c5af78582f07501f42d1e075eb4fc7b4991e28ef575eb27b43a644bb39a","observation_id":"132c4ec8-514f-4ddc-8667-ad41fefcd172","resolution":{"observed_at":"2026-08-16T10:47:35.799927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.778899Z","title":null,"venue":null,"work_id":"d3c09100-2581-4b11-a90d-e2d05aa85433","year":2019},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.241107Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:63ca7db61de217434e903baa091f86defb6c61202317f90fe49583842f76d571","observation_id":"75745099-7f8c-4d52-a522-0d47aaf49c69","resolution":{"observed_at":"2026-08-16T10:47:35.783616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.762498Z","title":"Gratton, V","venue":null,"work_id":"ccafce99-3673-4165-9231-b8b5e0ce69ce","year":2024},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.245979Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:a9807c1b709711d4863f93b38f957d44b15b16b274270c7384e4037d4ab1b6a4","observation_id":"1f19f6bf-a763-4515-bbb0-4ecf31ca5fe5","resolution":{"observed_at":"2026-08-16T10:47:35.767006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12562","last_updated":"2021-07-11T06:42:23Z","snapshot_observed_at":"2026-08-16T19:11:05.449942Z","submitted_at":"2020-10-23T17:44:59Z","title":"On the Transformer Growth for Progressive BERT Training","version":3},"cited_work":{"arxiv_id":"2010.12562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.12562","snapshot_observed_at":"2026-08-16T10:47:35.541176Z","title":"On the Transformer Growth for Progressive BERT Training","venue":"cs.CL","work_id":"fca867e5-d090-4556-a1e7-66b42de53e0f","year":2020},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.251108Z"},"links":{"cited_paper":"/paper/2010.12562","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:d2de3df28c10bcd5927758903aa3c524f23c72719a4087c12a12e7fe57846058","observation_id":"31a7479a-bc73-4642-a71a-028bc7d50c46","resolution":{"observed_at":"2026-08-16T10:47:35.546153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T10:47:35.256820Z","title":"Kaplan, S","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.256820Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:542b2e4dfa47c59beb1c79e1f01e8b8317bfb8fb6c2b44187704d2b15d66b482","observation_id":"a0ceb076-e790-41a4-824e-bf8b9b3125c5","resolution":{"observed_at":"2026-08-16T10:47:35.256820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.745720Z","title":"Kopaniˇcáková and R","venue":null,"work_id":"e3a22c25-db7f-4e3f-b114-316c8a103c4f","year":2022},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.261885Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:56ffc8fee466f538674ae88f9168579e30f09caa18330040547bae69ab3aa899","observation_id":"232b848b-4c0f-4b07-9fd7-30af0633d1b8","resolution":{"observed_at":"2026-08-16T10:47:35.750989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.729394Z","title":null,"venue":null,"work_id":"498b825d-1b25-48ff-b32b-feb040a58619","year":2024},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.266782Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:587cbb9b4066f910f4d40f108335807602a43ed378e2daf591108b1e446d32fa","observation_id":"3cb45f2f-e467-426a-8da9-a6932d1bf5cc","resolution":{"observed_at":"2026-08-16T10:47:35.734119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.713841Z","title":"Lauga, E","venue":null,"work_id":"a21151b3-f081-4a97-8f36-c5e8f01bb5d7","year":2024},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.271991Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:492095fe9461d0e630a66437340c9bd06a89548e28efabfef8f97e83bfcc73ad","observation_id":"588b1dc4-8636-4783-be1f-38e77e8d8df4","resolution":{"observed_at":"2026-08-16T10:47:35.718722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09176","last_updated":"2022-03-17T08:54:31Z","snapshot_observed_at":"2026-08-16T17:13:51.576753Z","submitted_at":"2022-03-17T08:54:31Z","title":"ODE Transformer: An Ordinary Differential Equation-Inspired Model for Sequence Generation","version":1},"cited_work":{"arxiv_id":"2203.09176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.09176","snapshot_observed_at":"2026-08-16T10:47:35.500998Z","title":"ODE Transformer: An Ordinary Differential Equation-Inspired Model for Sequence Generation","venue":"cs.CL","work_id":"28b08223-ae5a-40c0-aed0-0ca30a937390","year":2022},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.277017Z"},"links":{"cited_paper":"/paper/2203.09176","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:8e11e3033af530341c69c6c829751060214f8b8f5f068b278958d36dcba964a2","observation_id":"8c2f8830-7220-476b-affd-18c20cc474e3","resolution":{"observed_at":"2026-08-16T10:47:35.506056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08249","last_updated":"2023-10-01T18:34:20Z","snapshot_observed_at":"2026-08-07T23:54:19.429300Z","submitted_at":"2020-04-17T13:59:07Z","title":"Understanding the Difficulty of Training Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.08249","snapshot_observed_at":"2026-08-16T10:47:35.282331Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.282331Z"},"links":{"cited_paper":"/paper/2004.08249","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:97c272a5335decb50d84c1302add153c8c18bd54f750ac7b7264070834404231","observation_id":"7a61d24e-f828-4e9b-b5b7-3a64fe57e723","resolution":{"observed_at":"2026-08-16T10:47:35.282331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.698103Z","title":null,"venue":null,"work_id":"ec17a799-d1a8-407f-bd73-88f989c986a2","year":2021},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.287755Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:bbb203dd2879e5619132d151a0938aa2a712a686536aea00a6b21c6b9bc336dd","observation_id":"de837293-0650-49db-ba50-e0525d447baf","resolution":{"observed_at":"2026-08-16T10:47:35.703031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09684","last_updated":"2020-08-11T18:51:37Z","snapshot_observed_at":"2026-08-05T16:30:24.364735Z","submitted_at":"2020-05-19T18:07:14Z","title":"Exploring Transformers for Large-Scale Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09684","snapshot_observed_at":"2026-08-16T10:47:35.292408Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.292408Z"},"links":{"cited_paper":"/paper/2005.09684","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:bc24bbb852507ba38ad1ab0331fa5898c9384522f250c1d2df5f638e70c5ba16","observation_id":"c73b403a-9811-4f42-9249-20da5fcef414","resolution":{"observed_at":"2026-08-16T10:47:35.292408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.681697Z","title":"Penedo, H","venue":null,"work_id":"9b0064be-177d-493b-aa4d-1be062756ced","year":2024},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.297850Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:fd2db28d1578b4cc497a8f71d878821b3a6223846a034d80d77a7cf8b0d976db","observation_id":"c1ab8717-6967-42c0-9909-0c2039fb4ba6","resolution":{"observed_at":"2026-08-16T10:47:35.686816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.665710Z","title":"Quemener and M","venue":null,"work_id":"e98cd18b-b865-4c18-821d-e1f44d329f41","year":2013},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.302570Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:5468fda93baac077b2a1b00ae09fa611012fb74a8f2b55a679d0df50ed9c8b48","observation_id":"e282aa30-7704-413c-ae16-182c669bb71a","resolution":{"observed_at":"2026-08-16T10:47:35.670791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.307185Z","title":"Radford, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.307185Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:87f780289ea2c3abd1538ebffeba2b2f5d0c901832dde1afd04631886c4866cb","observation_id":"7795f1e0-724b-4a88-99db-188c588e0399","resolution":{"observed_at":"2026-08-16T10:47:35.307185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T10:47:35.311821Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.311821Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:59ab02a9de8bdcded680d7f8135347d9fa6b9a571468472e6eb73c3c27229892","observation_id":"0c27f562-a2f7-4ae1-a25a-a92ed8a62b65","resolution":{"observed_at":"2026-08-16T10:47:35.311821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:47:35.640439Z","title":"Vaswani, N","venue":null,"work_id":"c0cc210f-1549-4175-9d02-669a858f63f5","year":2017},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.316770Z"},"links":{"citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:9835bfa31403970d7c10e1b6ab6c3aa2a766709d76425cd7c11d64e6b66eb98b","observation_id":"3f157f21-6be3-440b-ab52-2fbf396242b6","resolution":{"observed_at":"2026-08-16T10:47:35.645250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00980","last_updated":"2023-03-02T05:21:18Z","snapshot_observed_at":"2026-08-16T15:51:30.318958Z","submitted_at":"2023-03-02T05:21:18Z","title":"Learning to Grow Pretrained Models for Efficient Transformer Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00980","snapshot_observed_at":"2026-08-16T10:47:35.321589Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.321589Z"},"links":{"cited_paper":"/paper/2303.00980","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:f0fe8d215106445c55afa52aeaf8cff6ac9b76dd8ece7b387cb9603e231d3acd","observation_id":"b4feb1a5-ce67-46aa-962c-446a901e70a7","resolution":{"observed_at":"2026-08-16T10:47:35.321589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03848","last_updated":"2021-10-08T01:23:34Z","snapshot_observed_at":"2026-08-16T17:50:58.747838Z","submitted_at":"2021-10-08T01:23:34Z","title":"Speeding up Deep Model Training by Sharing Weights and Then Unsharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03848","snapshot_observed_at":"2026-08-16T10:47:35.326873Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.326873Z"},"links":{"cited_paper":"/paper/2110.03848","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:4f229897e8cb576153e538acaf27e6c5b73348ac81db6d29901d785f70c1d234","observation_id":"f2488d91-bc84-4c69-9bb7-e3e961e3f049","resolution":{"observed_at":"2026-08-16T10:47:35.326873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-16T13:35:19.050691Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-16T10:47:35.331803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.331803Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:59d48e7d9e3c217f61aa5d3bb9577a2bbf916fb0b6e2cc07068993be188c3016","observation_id":"d6f58139-59c4-4296-9cc3-9bc13904363c","resolution":{"observed_at":"2026-08-16T10:47:35.331803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07999","last_updated":"2024-04-07T03:04:34Z","snapshot_observed_at":"2026-08-16T14:03:03.617406Z","submitted_at":"2024-04-07T03:04:34Z","title":"A Multi-Level Framework for Accelerating Training Transformer Models","version":1},"cited_work":{"arxiv_id":"2404.07999","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07999","snapshot_observed_at":"2026-08-16T10:47:35.373733Z","title":"A Multi-Level Framework for Accelerating Training Transformer Models","venue":"cs.LG","work_id":"d24440d4-454c-4f72-9c76-03ff11f3f152","year":2024},"citing_paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:35.336584Z"},"links":{"cited_paper":"/paper/2404.07999","citing_paper":"/paper/2504.18590"},"observation_digest":"sha256:25f357b5bc5c1ff968e8907321477a6734859bbf720a8bec8b543b20da16b8bf","observation_id":"129c71b4-b63a-4541-b10f-b69a28dfa524","resolution":{"observed_at":"2026-08-16T10:47:35.381340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18590","last_updated":"2025-04-24T08:23:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T16:48:09.152639Z","submitted_at":"2025-04-24T08:23:50Z","title":"A multilevel approach to accelerate the training of Transformers"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2504.18590."}