{"as_of":"2026-08-12T06:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74505e75ee852cdb9ff078404c415f6c1ec9aea511fc08623eb7375fa204a1a7","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:49:31.359221Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:12:14.575187Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T13:12:15.014269Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"cited_work":{"arxiv_id":"2507.07247","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07247","snapshot_observed_at":"2026-08-05T13:12:15.014269Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","venue":"cs.LG","work_id":"277ec134-4754-4059-a7b3-c2b386490bbb","year":2025},"citing_paper":{"arxiv_id":"2509.00914","last_updated":"2025-08-31T15:57:13Z","snapshot_observed_at":"2026-08-09T09:56:48.034006Z","submitted_at":"2025-08-31T15:57:13Z","title":"TinyMusician: On-Device Music Generation with Knowledge Distillation and Mixed Precision Quantization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:12:14.575187Z"},"links":{"cited_paper":"/paper/2507.07247","citing_paper":"/paper/2509.00914"},"observation_digest":"sha256:9ba5a441b700a14f455246ef77577d0d6c700831f6e038d21dbb2a29ee4edc2f","observation_id":"ffbc3d9f-18f9-45bd-84f3-2e2dc29befe4","resolution":{"observed_at":"2026-08-05T13:12:15.021355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07247/citation-record","integrity":"/paper/2507.07247/integrity","json":"/paper/2507.07247/citation-record.json","paper":"/paper/2507.07247"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:32.144116Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"2447c736-c949-46f9-9f89-7a8ad5cd5c07","year":2023},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:28.577361Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:0470355d40add268fe1cdd3426663f748043bc2aa67cd75a06f982f4671e5577","observation_id":"6cf53606-8de5-4086-ab05-fb368b05af2e","resolution":{"observed_at":"2026-08-06T18:49:32.184447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T18:49:28.674929Z","title":"Longformer: The long-document transformer.arXiv preprint arXiv:2004.05150, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:28.674929Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:2dd37bd53ee1c0af7a75f877391ad1c6fe4f4b6322286acd2f5a0605072e9e2a","observation_id":"1533ce51-d99d-4c43-9ab5-aa7496a948fa","resolution":{"observed_at":"2026-08-06T18:49:28.674929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:28.795980Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:28.795980Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:2c94d323f2a8563a14b0b5401f0363a7fe6aee7b5f82df01aff353104edc1ac4","observation_id":"9f591f89-7700-418e-b8df-a1a3def8fc68","resolution":{"observed_at":"2026-08-06T18:49:28.795980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-11T00:43:48.374986Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-06T18:49:28.926685Z","title":"A survey on mixture of experts.arXiv preprint arXiv:2407.06204, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:28.926685Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:b7b46c24b2853929204dd0fcdd69e28909d010c69cc45319d20353f296cb7d42","observation_id":"31842f1f-22df-4fa8-b928-36d054ac923a","resolution":{"observed_at":"2026-08-06T18:49:28.926685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T18:49:29.014289Z","title":"Albert q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:29.014289Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:fb065dd65f5f66f612d9a5b260a84bc3dc03359aa92137927878ff9bd965d214","observation_id":"00fe90b1-eca0-4fa8-bbed-96fef63323d3","resolution":{"observed_at":"2026-08-06T18:49:29.014289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T18:49:29.131991Z","title":"Flashattention-2: Faster attention with better parallelism and work par- titioning.arXiv preprint arXiv:2307.08691, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:29.131991Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:3356c928fb4d125a52aac796b0205ec02ad595494832b20282776335a6fadec8","observation_id":"e9a03435-44cf-4273-99ca-97cf53047db9","resolution":{"observed_at":"2026-08-06T18:49:29.131991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:29.340857Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:29.340857Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:8548d44b3dc7d719c7f6afabc8ca7f10e4269a56c54ed344000ed2e3c6cdd8c4","observation_id":"b7405c27-eb12-49ec-8a28-95bf65de53e8","resolution":{"observed_at":"2026-08-06T18:49:29.340857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T18:49:29.476510Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:29.476510Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:360ad38ed08c21956af40d6b242656924d76e5fcc0471bada689ff1811190adf","observation_id":"a8d00c93-1e0c-4328-8462-70dc040141a6","resolution":{"observed_at":"2026-08-06T18:49:29.476510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:31.969283Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"8e3c263a-9d0d-4b40-b8a7-9a5f4aea56a6","year":2020},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:29.571072Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:0169f446013bfecfba02b95bb882d4f132d0f4c50356b3f5ae32d64063c0197c","observation_id":"755cb5cb-0c59-423a-86d6-f1eb0e9ca330","resolution":{"observed_at":"2026-08-06T18:49:32.038803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-06T18:49:29.774607Z","title":"Reformer: The efficient transformer.arXiv preprint arXiv:2001.04451, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:29.774607Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:80bcc422c4fd47f4567d18c889aa39eb4b2538727ec3c74f5220e46679f68aa3","observation_id":"74e448d5-098f-47c4-882a-7e469cfa1ad3","resolution":{"observed_at":"2026-08-06T18:49:29.774607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-08-10T20:15:22.942936Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-06T18:49:29.910594Z","title":"Quantifying the carbon emissions of machine learning.arXiv preprint arXiv:1910.09700, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:29.910594Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:9b32e66d02a6b972aa2c352b3b4831e58150132d8a3055dc64db882e250c7f3b","observation_id":"be6113b3-f2d7-4b5e-a197-90b2e4be4697","resolution":{"observed_at":"2026-08-06T18:49:29.910594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T18:49:30.129660Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:30.129660Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:11d057cd3dd365874caebc3f19ad05b83984b6993980e057ddb11b7d44a18f14","observation_id":"ffa8de1a-26bd-414b-b30b-80eefda2c3c2","resolution":{"observed_at":"2026-08-06T18:49:30.129660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.04025","last_updated":"2015-09-20T08:25:52Z","snapshot_observed_at":"2026-07-06T04:26:53.382258Z","submitted_at":"2015-08-17T13:43:19Z","title":"Effective Approaches to Attention-based Neural Machine Translation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.04025","snapshot_observed_at":"2026-08-06T18:49:30.250557Z","title":"Effective approaches to attention-based neural machine translation.arXiv preprint arXiv:1508.04025, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:30.250557Z"},"links":{"cited_paper":"/paper/1508.04025","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:cbaa5e667785afd37b465999f6c209a87f986f20d1c02d0e3391c4cb12d639e1","observation_id":"70ab1e9f-5c2c-4333-b7f7-16a8554a145c","resolution":{"observed_at":"2026-08-06T18:49:30.250557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10350","last_updated":"2021-04-23T14:26:29Z","snapshot_observed_at":"2026-07-06T11:02:18.405330Z","submitted_at":"2021-04-21T04:44:25Z","title":"Carbon Emissions and Large Neural Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10350","snapshot_observed_at":"2026-08-06T18:49:30.411057Z","title":"Carbon emissions and large neural network training.arXiv preprint arXiv:2104.10350, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:30.411057Z"},"links":{"cited_paper":"/paper/2104.10350","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:1b4fc174e53aeebc72eaf28bada5fb699398d71f71a95ff4e02718e21abdc7c7","observation_id":"ed3808c3-76ac-4ea5-afe4-27c6cf5c273b","resolution":{"observed_at":"2026-08-06T18:49:30.411057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:30.548924Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:30.548924Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:a27ed8406b5586020ad89c901c8b9ede8b1baa5d03d1d13daca8a775bb604420","observation_id":"c4370051-ebf6-4773-af57-522149c7b46d","resolution":{"observed_at":"2026-08-06T18:49:30.548924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:31.790691Z","title":null,"venue":null,"work_id":"d9ebb224-1669-4f6f-afce-896eb41fd3b7","year":2025},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:30.637719Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:17b663755e09cbafb5855c604a98f41c9cea9fdb044ee5d932da73573d520e49","observation_id":"79f30ed3-99bb-44da-94ba-d70040ed9d57","resolution":{"observed_at":"2026-08-06T18:49:31.864535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:30.803553Z","title":"Green ai.Communications of the ACM, 63(12):54–63, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:30.803553Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:02be5fff8034d772e3bbd09f531ad8114c9d5340caec4976267b79d1b98eb53c","observation_id":"1992ae56-455a-401c-8403-ae7e2edc3a7b","resolution":{"observed_at":"2026-08-06T18:49:30.803553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:31.632123Z","title":"Energy and policy considerations for modern deep learning research","venue":null,"work_id":"b3cf4cdc-0e34-4490-b9bd-7801129fecf4","year":2020},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:30.906531Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:b2bf7abe45470bc850153207f9eb9e6dad0d645a29a3d35ef861cbcfa21d3c44","observation_id":"842477b6-8365-401a-8968-9eee0eaeaadb","resolution":{"observed_at":"2026-08-06T18:49:31.688398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:31.036877Z","title":"Efficient transformers: A survey.ACM Computing Surveys, 55(6):1–28, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:31.036877Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:320b67072078a158c75e693429238672c53514312bde49814dd69ef5f0ea5296","observation_id":"9220446c-df68-4ee6-9ed7-bd9ba74ea654","resolution":{"observed_at":"2026-08-06T18:49:31.036877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:49:31.167414Z","title":"Llama 2: Open foundation and fine- tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:31.167414Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:760da1167b303a161685f293d11cfd04b440cbecc4ba4425b0fcb333e72bef33","observation_id":"3ae101e6-33f7-4f5b-84f9-7d2e3cfcdf37","resolution":{"observed_at":"2026-08-06T18:49:31.167414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:31.296532Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:31.296532Z"},"links":{"citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:1fb0baa91a3e141a0bb08df1e9f5317d2cec6858d7b6ae62659ae242331efc4b","observation_id":"6d1c79d3-7965-4a30-adfe-fdf4735c951a","resolution":{"observed_at":"2026-08-06T18:49:31.296532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T18:49:31.359221Z","title":"A survey of large language models.arXiv preprint arXiv:2303.18223, 1(2), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:31.359221Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2507.07247"},"observation_digest":"sha256:8bd659631376e4c56f17d2959b62aa5c460ac7b0fd41a7c9d30ba13c0d12a248","observation_id":"e91dfe5c-f852-4e72-9476-8c90bf24d91f","resolution":{"observed_at":"2026-08-06T18:49:31.359221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07247","last_updated":"2026-07-19T13:13:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:58:58.832875Z","submitted_at":"2025-07-09T19:37:23Z","title":"Attentions Under the Microscope: A Comparative Study of Resource Utilization for Variants of Self-Attention"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2507.07247."}