{"as_of":"2026-08-05T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4af0a7610333f0a550d198e1669c3dc0807de16470d781e647e2ccf9320808a3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:14:46.158438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:58:58.624838Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":203,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:af9fdd270d1b333cde99368c2221aaf46726b7923b00ad1f4687d7c4c285b307","observation_id":"f5c8e044-8d91-4c13-8ae6-394d6e6722d2","resolution":{"observed_at":"2026-05-12T23:14:25.884221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-13T23:19:46.231145Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2303.17564"},"observation_digest":"sha256:b16d398d13c5635fa80664ea5fafd476ddacc6b94aa38cb91c1f70b622b626c6","observation_id":"7cbb63ad-5a56-42f2-8554-9bf072061909","resolution":{"observed_at":"2026-05-13T23:19:46.822979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-07-06T15:33:27.761070Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:098923161b6f1a52d668f5677c1c253b6b489266ae903bc18991923de7fc6cd2","observation_id":"5bdfa959-e310-4485-baac-dd5456fe053f","resolution":{"observed_at":"2026-05-18T01:35:21.396172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2403.07815","last_updated":"2024-11-04T17:42:45Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T16:53:54Z","title":"Chronos: Learning the Language of Time Series","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-13T08:27:23.298009Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2403.07815"},"observation_digest":"sha256:13b6f652102e11914fac4ea6e2673fa47d3229be0241b6a2bc1fa57c5a0d380d","observation_id":"4ac6baf2-3cc7-48da-a810-1e916a881b4e","resolution":{"observed_at":"2026-05-13T08:27:23.392866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-04T09:14:46.158438Z","title":"Scale efficiently: Insights from pre-training and fine-tuning trans- formers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.16658","last_updated":"2026-05-27T22:39:15Z","snapshot_observed_at":"2026-08-04T09:14:35.954475Z","submitted_at":"2025-10-18T22:45:59Z","title":"Large-Scale AI and Foundation Models for Neuroscience: A Comprehensive Review","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T09:14:46.158438Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2510.16658"},"observation_digest":"sha256:04f713e821185597d6536c2021ffa50e7247ac6c5734fc19cf2c52dfb12922c0","observation_id":"573986e9-fc42-4169-9db4-cb78c5561e47","resolution":{"observed_at":"2026-08-04T09:14:46.158438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:f5b10a74f34f52cfed086f68b239887683f247fbecfffe2fe403ff22432818fa","observation_id":"ad6a4eb1-b724-46c8-9c8d-59507364db17","resolution":{"observed_at":"2026-05-18T05:30:55.097385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2604.02320","last_updated":"2026-04-07T17:25:24Z","snapshot_observed_at":"2026-08-03T09:00:04.952404Z","submitted_at":"2026-04-02T17:58:40Z","title":"Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T21:32:39.946578Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2604.02320"},"observation_digest":"sha256:1930b898437201dfedc52f708e5d76d9746e8e6f0e244bd66eb0c0d569de013c","observation_id":"15cfc1ff-6bfc-4712-9e17-e679d507a60f","resolution":{"observed_at":"2026-05-13T21:33:18.336782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2606.18246","last_updated":"2026-06-16T17:59:03Z","snapshot_observed_at":"2026-08-02T16:01:00.670614Z","submitted_at":"2026-06-16T17:59:03Z","title":"Variable-Width Transformers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T00:57:22.872902Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2606.18246"},"observation_digest":"sha256:c1bae078d9e40e15493d20c3115fef041bfd4e53f0a6d04b23b66842c8174303","observation_id":"93b62383-9748-40ad-aebb-e83093829b24","resolution":{"observed_at":"2026-07-03T20:58:58.626372Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2109.10686/citation-record","integrity":"/paper/2109.10686/integrity","json":"/paper/2109.10686/citation-record.json","paper":"/paper/2109.10686"},"outbound":[],"paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2109.10686."}