{"as_of":"2026-08-08T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a8f1cc9239e8010baf46e165658485fd31258b1b2bdebc5f3823dc1be8a023e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:49:41.405182Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:59:07.199652Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-08-07T21:49:41.405182Z","title":"Cordonnier, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09346","last_updated":"2025-02-13T14:11:33Z","snapshot_observed_at":"2026-08-07T21:45:10.315610Z","submitted_at":"2025-02-13T14:11:33Z","title":"Machine learning for modelling unstructured grid data in computational physics: a review","version":1},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-08-07T21:49:41.405182Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2502.09346"},"observation_digest":"sha256:5d570a83f28d136d47dff117263fe82d2a4f878b62bb6fb155007dc1538cf103","observation_id":"4cde047a-56b9-4381-bdae-4264c298578a","resolution":{"observed_at":"2026-08-07T21:49:41.405182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-08-07T12:43:53.773851Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23694","last_updated":"2025-06-01T16:02:18Z","snapshot_observed_at":"2026-08-07T12:37:25.617891Z","submitted_at":"2025-05-29T17:31:26Z","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.773851Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2505.23694"},"observation_digest":"sha256:d9b7a874f30f8b377d37787fb093520a5cb15ea0777349f5742af585005ca74e","observation_id":"bfb516be-3d0d-46e4-ad9f-a67f2da0f139","resolution":{"observed_at":"2026-08-07T12:43:53.773851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-08-06T20:04:02.222947Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.03947","last_updated":"2025-07-30T12:47:25Z","snapshot_observed_at":"2026-08-08T16:54:24.903914Z","submitted_at":"2025-07-05T08:13:09Z","title":"Graph Collaborative Attention Network for Link Prediction in Knowledge Graphs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:02.222947Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2507.03947"},"observation_digest":"sha256:df85279a0019a413d983d021cfb0218f8e3f7b94b6edcec47b2715d19f6a1330","observation_id":"3217490d-0618-4117-b085-1b8e2a061a55","resolution":{"observed_at":"2026-08-06T20:04:02.222947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-08-06T15:07:27.694769Z","title":"Cordonnier, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16743","last_updated":"2025-07-22T16:34:21Z","snapshot_observed_at":"2026-08-08T09:34:50.079246Z","submitted_at":"2025-07-22T16:34:21Z","title":"Denoising-While-Completing Network (DWCNet): Robust Point Cloud Completion Under Corruption","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:27.694769Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2507.16743"},"observation_digest":"sha256:fec48335074078649d0dea2352684f71c4a2b3b0aa1594c279ee6e26ac68e052","observation_id":"ebda3e18-8766-48c4-a1d1-96f986393df6","resolution":{"observed_at":"2026-08-06T15:07:27.694769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":"2006.16362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-07-03T23:59:07.199652Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":"122d504b-cee2-47b2-afb8-f2bad267791e","year":2006},"citing_paper":{"arxiv_id":"2604.16505","last_updated":"2026-04-14T17:49:56Z","snapshot_observed_at":"2026-07-06T23:03:48.168078Z","submitted_at":"2026-04-14T17:49:56Z","title":"Predicting Blastocyst Formation in IVF: Integrating DINOv2 and Attention-Based LSTM on Time-Lapse Embryo Images","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:33.452260Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2604.16505"},"observation_digest":"sha256:a4ae122cae8b6bf43dc4d9dc74e0603a35c4a78f1c6cff26f25380b9a905e0c5","observation_id":"7bbea0b1-2fd6-4850-a599-b005f526db59","resolution":{"observed_at":"2026-05-11T09:26:00.741619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":"2006.16362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-07-03T23:59:07.199652Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":"122d504b-cee2-47b2-afb8-f2bad267791e","year":2006},"citing_paper":{"arxiv_id":"2605.05653","last_updated":"2026-05-07T04:09:11Z","snapshot_observed_at":"2026-08-06T19:38:14.702022Z","submitted_at":"2026-05-07T04:09:11Z","title":"Negative Before Positive: Asymmetric Valence Processing in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T11:13:15.576248Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2605.05653"},"observation_digest":"sha256:55ffe9c7cddb924e607ff03eb69c835217f354c59af6f20ab66871bf8d19eb2f","observation_id":"79d90910-5dae-4fa4-a5a3-5e893d6a9d35","resolution":{"observed_at":"2026-05-11T19:41:10.234565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":"2006.16362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-07-03T23:59:07.199652Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":"122d504b-cee2-47b2-afb8-f2bad267791e","year":2006},"citing_paper":{"arxiv_id":"2605.08853","last_updated":"2026-05-09T10:05:22Z","snapshot_observed_at":"2026-08-03T05:44:03.275032Z","submitted_at":"2026-05-09T10:05:22Z","title":"Architecture, Not Scale: Circuit Localization in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:19:23.901130Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2605.08853"},"observation_digest":"sha256:9ea458620b9f3c848f0ab5e76a3c731aaefc2a46c7c4367e884dc6514800bbff","observation_id":"cfa152e5-fc12-4150-8ee7-42b11045ee57","resolution":{"observed_at":"2026-05-12T02:21:16.730981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":"2006.16362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-07-03T23:59:07.199652Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":"122d504b-cee2-47b2-afb8-f2bad267791e","year":2006},"citing_paper":{"arxiv_id":"2605.19775","last_updated":"2026-05-19T12:43:51Z","snapshot_observed_at":"2026-08-08T18:12:35.288435Z","submitted_at":"2026-05-19T12:43:51Z","title":"Understanding Inference Scaling for LLMs: Bottlenecks, Trade-offs, and Performance Principles","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T02:11:26.925234Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2605.19775"},"observation_digest":"sha256:d4a805147bc20c53209d2a3beb55284a23de3d101c4df652082e0c38ffdde932","observation_id":"2a9a8dd0-c925-4770-b78a-d4aefb86c975","resolution":{"observed_at":"2026-05-20T02:12:58.240864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate","version":2},"cited_work":{"arxiv_id":"2006.16362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.16362","snapshot_observed_at":"2026-07-03T23:59:07.199652Z","title":"Multi-head attention: Collaborate instead of concatenate","venue":null,"work_id":"122d504b-cee2-47b2-afb8-f2bad267791e","year":2006},"citing_paper":{"arxiv_id":"2606.18967","last_updated":"2026-06-17T11:51:06Z","snapshot_observed_at":"2026-08-02T03:11:43.085236Z","submitted_at":"2026-06-17T11:51:06Z","title":"EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T21:32:41.428871Z"},"links":{"cited_paper":"/paper/2006.16362","citing_paper":"/paper/2606.18967"},"observation_digest":"sha256:466b90819a5801ca7dd6e85f23b900d626cadaba1da1098df3cc390b35fba796","observation_id":"096435c1-5ca0-491d-a364-d197d4d79e39","resolution":{"observed_at":"2026-07-03T23:59:07.202274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2006.16362/citation-record","integrity":"/paper/2006.16362/integrity","json":"/paper/2006.16362/citation-record.json","paper":"/paper/2006.16362"},"outbound":[],"paper":{"arxiv_id":"2006.16362","last_updated":"2021-05-20T14:48:30Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T17:26:35.093147Z","submitted_at":"2020-06-29T20:28:52Z","title":"Multi-Head Attention: Collaborate Instead of Concatenate"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2006.16362."}