{"as_of":"2026-08-08T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60abf02463ca7796e063c220df059483268f2f1cb0766e87d41c3503ae51f1e4","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:13.982716Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T20:22:55.750693Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"cited_work":{"arxiv_id":"2505.19529","doi":"10.48550/arxiv.2505.19529","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19529","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"ef849c0c-7367-4339-b3d4-dbcd2e815f31","year":null},"citing_paper":{"arxiv_id":"2605.16991","last_updated":"2026-05-16T13:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T13:22:57Z","title":"Response-free item difficulty modelling for multiple-choice items with fine-tuned transformers: Component-wise representation and multi-task learning","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-19T20:22:55.750693Z"},"links":{"cited_paper":"/paper/2505.19529","citing_paper":"/paper/2605.16991"},"observation_digest":"sha256:c97d5f58e78dcdc2feb155534cffe7113c57de42955412826d8ec739e2418506","observation_id":"badbdbc5-1620-4e3c-a4d0-e4d8509464f9","resolution":{"observed_at":"2026-05-19T20:23:12.763744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19529/citation-record","integrity":"/paper/2505.19529/integrity","json":"/paper/2505.19529/citation-record.json","paper":"/paper/2505.19529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.739182Z","title":"Paligemma: Towards compact vision encoders for multi- modal models.Transactions on Image Processing,","venue":null,"work_id":"e0a67f73-81a9-4aa5-a43f-da588d38d809","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.400821Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5a7ad48dd9e786082da2b69362312046021f14790903a05576cbe1df0b74292c","observation_id":"ba269e43-3d07-482d-9e57-8d183c7e61d0","resolution":{"observed_at":"2026-08-07T14:17:17.827205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.543163Z","title":"In- ternvl2: Scalable multi-modal models with reduced vision encoder complexity","venue":null,"work_id":"2a5fc9fa-0b15-445f-a9e6-e7c8e45b362a","year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.455294Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:ee1dfbe1b0561f9c325f12998ab1bd34a6616d44e7e43940eeba7a7d078b6da2","observation_id":"e57543c6-54ef-47d4-a4bd-08ba2221afcd","resolution":{"observed_at":"2026-08-07T14:17:17.607727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-07T14:17:11.462045Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.arXiv preprint arXiv:2205.14135,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.462045Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:f3ae03bfd3de626a8a2c79b907cf5ae493d90c563f8c603159f65b9e1cb1d2df","observation_id":"525d393f-0f0e-47c6-b7b5-8a59b7d7bd7a","resolution":{"observed_at":"2026-08-07T14:17:11.462045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T14:17:11.511088Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.511088Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:b5937568803e43bf217eb0c229e8eed197292186cec8eeaa155593a4609d381c","observation_id":"32760e6c-4e9b-4439-b832-db51f67a6641","resolution":{"observed_at":"2026-08-07T14:17:11.511088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-07-06T09:58:19.547859Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-07T14:17:11.537923Z","title":"Realtoxic- ityprompts: Evaluating neural toxic degeneration in lan- guage models.arXiv preprint arXiv:2009.11462,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.537923Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5c7c5be03a13433e52b2e13a22417f8e8315334788f6b6f2d75a51c069e0736e","observation_id":"9e20b6e3-3618-43d1-9032-172cf5660d5e","resolution":{"observed_at":"2026-08-07T14:17:11.537923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.980669Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallu- cination and visual illusion in large vision-language models","venue":null,"work_id":"b9580f3a-bc47-4b87-bc8f-3824fe6f4f89","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.622080Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:6af23f84d88f445718789cc4fdae2018f2464d51c571b023bafead91405cd0b4","observation_id":"4d57117a-8ee2-4611-88a2-76b622201287","resolution":{"observed_at":"2026-08-07T14:17:17.071197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.750883Z","title":"Learning both weights and connections for efficient neural networks.Advances in Neural Infor- mation Processing Systems (NeurIPS), pages 1135–1143,","venue":null,"work_id":"755e26de-caa1-499c-b331-a670ac75241b","year":2015},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.624558Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:2491b9fc707a631faeb1b0a763dd93a30346149dee797971387921a939b7c039","observation_id":"fea74fcc-4562-4db2-aa15-11db796590ed","resolution":{"observed_at":"2026-08-07T14:17:16.844833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.599543Z","title":null,"venue":null,"work_id":"9639cb58-1737-4ec9-9234-620c53068667","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.682390Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:b1f377bcce941e23d39d2145c5b48c19ddc099e94f941973199adbb9499b73cd","observation_id":"ff6090e1-6391-4622-93ba-414497b53be0","resolution":{"observed_at":"2026-08-07T14:17:16.646144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.448402Z","title":"Hooper and T","venue":null,"work_id":"f1ebbb34-5d1d-4e0c-949d-5bbae4078361","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.691663Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:4790e48db181edd16028c9a774cf2e143ed214a1356bf8548e31fc6e238c0ad4","observation_id":"f8778558-a2fb-4087-b379-4913e0515162","resolution":{"observed_at":"2026-08-07T14:17:16.517334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:11.707616Z","title":"The price of prompting: Profiling energy use in large language models inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.707616Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:a77a1837400652f1d335467429b4453d75e22d22b1ec2a6cc289340e917c67f1","observation_id":"1d13cc24-f49a-4213-8240-4295edffd042","resolution":{"observed_at":"2026-08-07T14:17:11.707616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12345","last_updated":"2025-06-17T20:37:32Z","snapshot_observed_at":"2026-08-06T10:45:08.715526Z","submitted_at":"2024-01-22T20:20:48Z","title":"Distributionally Robust Receive Combining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12345","snapshot_observed_at":"2026-08-07T14:17:11.711326Z","title":"Mobilellm: Efficient adaptation of large language models for mobile devices.ArXiv Preprint, abs/2401.12345,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.711326Z"},"links":{"cited_paper":"/paper/2401.12345","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:03b2ca514b46c077702f07a76e55ab643106cd5c454653d7596116a17506138b","observation_id":"bc43c28a-25c9-4381-8c83-bf0b92b7143b","resolution":{"observed_at":"2026-08-07T14:17:11.711326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-07T22:21:53.513424Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-07T14:17:11.727608Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.727608Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:39cd2fe2ad69cccbd1fa7bcadf705681b46be7ff8c0e56679e62591bc3f94d8b","observation_id":"b72f986e-e1fa-4137-948d-6f3944b454e4","resolution":{"observed_at":"2026-08-07T14:17:11.727608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:17:11.863978Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.863978Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:353de207a2645afe0579383d8341c6ce7d2faacf821896c7d55521363a323a09","observation_id":"08c83d54-410e-45a5-b4c7-e695f2d79c0d","resolution":{"observed_at":"2026-08-07T14:17:11.863978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.122012Z","title":"Idefics2: Efficient multi-modal fusion with lightweight visual encoders.Transactions on Pattern Anal- ysis and Machine Intelligence,","venue":null,"work_id":"cfa4dbdb-b496-4794-bc65-a7d564ccdce7","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.055737Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:388faf5c0ee2657177f4e7bc2499581686a9b2c17afb1b45c2bdb2962a5cb591","observation_id":"27f3e6c1-68fc-4035-9afd-f44d73be0d70","resolution":{"observed_at":"2026-08-07T14:17:16.234259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-07T14:17:12.163973Z","title":"The power of scale for parameter-efficient prompt tuning.arXiv preprint arXiv:2104.08691,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.163973Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:7de144e590dce446dff9c9bb0d51a892311da55df23ea212699efc0ccf4c361a","observation_id":"3067529d-1b04-41d2-93d5-bf95167f3788","resolution":{"observed_at":"2026-08-07T14:17:12.163973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:17:12.320067Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.320067Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:8b9b5b848bef572be2b96593e09e800e2041e6e0147e7924d7999aea9c0aa839","observation_id":"981ae193-7e67-442a-9c3b-1bf192d17e9e","resolution":{"observed_at":"2026-08-07T14:17:12.320067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12787","last_updated":"2024-09-06T04:30:50Z","snapshot_observed_at":"2026-08-08T12:44:57.771092Z","submitted_at":"2024-08-23T01:37:29Z","title":"LLM-PBE: Assessing Data Privacy in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12787","snapshot_observed_at":"2026-08-07T14:17:12.334623Z","title":"Llm-pbe: Assess- ing data privacy in large language models.arXiv preprint arXiv:2408.12787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.334623Z"},"links":{"cited_paper":"/paper/2408.12787","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:ef5da9bd438f99bc90f93277190be5e9c527353b2e1baf09aa0d14566b9a8134","observation_id":"f737957a-7371-4b8e-aa36-43a5b9c3ab8f","resolution":{"observed_at":"2026-08-07T14:17:12.334623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.797569Z","title":"Sophia: A memory-efficient optimizer for large-scale model training","venue":null,"work_id":"e158a2ca-ed63-41aa-92ef-7ff5dcf3c2ea","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.352967Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:f1d713489dcd4314581fac4d7d96c59a2db9c19fc9e312cd7aa947b82ea64cc7","observation_id":"0a63797f-8042-4a1f-9fa6-f06e84a5dd47","resolution":{"observed_at":"2026-08-07T14:17:15.892780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05499","last_updated":"2025-12-29T02:25:27Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-08T18:43:11Z","title":"Prompt Injection attack against LLM-integrated Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05499","snapshot_observed_at":"2026-08-07T14:17:12.481222Z","title":"Prompt in- jection attack against llm-integrated applications.arXiv preprint arXiv:2306.05499,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.481222Z"},"links":{"cited_paper":"/paper/2306.05499","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:cbafd1f549a3f9fe83ffbf353c370508535c1d680fe2683efe9b8be4efafa752","observation_id":"c58d0578-9101-470e-9eef-932886b97af9","resolution":{"observed_at":"2026-08-07T14:17:12.481222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03900","last_updated":"2024-06-29T14:07:20Z","snapshot_observed_at":"2026-07-06T17:40:33.769700Z","submitted_at":"2024-03-06T18:00:15Z","title":"Mamba4Rec: Towards Efficient Sequential Recommendation with Selective State Space Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03900","snapshot_observed_at":"2026-08-07T14:17:12.496846Z","title":"Mamba4rec: Towards efficient sequential recommendation with selective state space models.arXiv preprint arXiv:2403.03900,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.496846Z"},"links":{"cited_paper":"/paper/2403.03900","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:9cb2c4df3027ea677066b4b5b9ef9f6dd07aa6ce6f805b68d219d8f53eca20a0","observation_id":"eb9bae79-ec57-4a33-8ce0-de74faecff51","resolution":{"observed_at":"2026-08-07T14:17:12.496846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T14:17:12.591921Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.591921Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:e4c226b3102eeab7d798caa7814680c07891410c40f934d49814064c89225508","observation_id":"1d4ac386-14aa-4d58-aa36-a2e399a61ba2","resolution":{"observed_at":"2026-08-07T14:17:12.591921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.583534Z","title":"Mono-internvl: Mlp-based architectures for efficient multi-modal fusion","venue":null,"work_id":"09e20a21-32bc-431e-ab63-415ffd534a88","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.651520Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:320bba78fdb5d56bd1cc21634aad098481336e9af37818a2030ee1dd9738ca93","observation_id":"9d9c8a15-0f85-4924-8d95-e20f4bf3def6","resolution":{"observed_at":"2026-08-07T14:17:15.694658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.345101Z","title":"Mixed pre- cision training","venue":null,"work_id":"98f0902e-9d97-4ba0-a99e-894e40849bf0","year":2018},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.683775Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:f836550fa778d923b2e574f1b48d5302afa87ca9631b03787e5e441afe47055f","observation_id":"1aafba37-afd3-47b5-9cbb-b195ed8b7c2c","resolution":{"observed_at":"2026-08-07T14:17:15.483641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.144832Z","title":"Characterizing power management opportunities for llms in the cloud","venue":null,"work_id":"fbe6da33-863e-4b7c-b8bb-2045ba687758","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.854614Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:6aaf6002f392cd71832b9dbbfa872684a3b724f1ba25a6d97e9787279489dec6","observation_id":"26686d04-756c-47ad-92a1-c9c358329c4a","resolution":{"observed_at":"2026-08-07T14:17:15.242828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T14:17:12.868317Z","title":"Rwkv: Reinventing rnns for the transformer era.arXiv preprint arXiv:2305.13048,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.868317Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:195e1d375a96d92f4d0ad057689ae5fb9f7f7b42d5192f416b26370326ddd1b3","observation_id":"7a85df90-f420-45fa-bcbc-c293d55f41b0","resolution":{"observed_at":"2026-08-07T14:17:12.868317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.981634Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"c71fd55d-124a-4539-883d-f9e21b919dfa","year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.929444Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:d4fb4936824819d0baaa952ad5eb382dac9aadee81673d9cf6f97d0f5a2677e5","observation_id":"f7bc1586-190f-42cd-8d59-7db0f3401569","resolution":{"observed_at":"2026-08-07T14:17:15.051946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T14:17:13.000942Z","title":"Scaling language models: Methods, analysis & insights from training gopher.arXiv preprint arXiv:2112.11446,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.000942Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:085a2b16ae3b5b156ff02765a988f21d8dbf5ec8a471f463c817182c6d1e4509","observation_id":"9c80f438-bf06-4bac-9da0-17b54e578f5c","resolution":{"observed_at":"2026-08-07T14:17:13.000942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.919439Z","title":"A primer in bertology: What we know about how bert works.Transactions of the Association for Com- putational Linguistics, 8:842–866,","venue":null,"work_id":"021a0e01-0a42-4f89-a8f5-045740443169","year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.036025Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:7dae67f0dfec7216f8339bacf6c848dc730019713e17fbeca77038f531977e80","observation_id":"8c0302bc-9844-495f-9d82-d0cd79918f66","resolution":{"observed_at":"2026-08-07T14:17:14.957140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T14:17:13.080609Z","title":"Distilbert, a distilled version of bert: Smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.080609Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:1df69715ba3902123f01dc5fd6aea722b669ab98a7cfb28d499dc5c4c1b396a1","observation_id":"6bc4f6ac-cdfd-4a87-9005-923b38063684","resolution":{"observed_at":"2026-08-07T14:17:13.080609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20306","last_updated":"2024-03-29T17:22:48Z","snapshot_observed_at":"2026-07-06T17:53:11.000124Z","submitted_at":"2024-03-29T17:22:48Z","title":"Towards Greener LLMs: Bringing Energy-Efficiency to the Forefront of LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20306","snapshot_observed_at":"2026-08-07T14:17:13.163081Z","title":"Towards greener llms: Bringing energy-efficiency to the forefront of llm inference.arXiv preprint arXiv:2403.20306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.163081Z"},"links":{"cited_paper":"/paper/2403.20306","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:3e599eb29026c67098e5ed1f6d452db47534c1dc38d4343114b78b4aaf056dd6","observation_id":"22d5c83e-5765-4de7-84be-7ec87f3ab893","resolution":{"observed_at":"2026-08-07T14:17:13.163081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:13.228754Z","title":"Dy- namollm: Designing llm inference clusters for performance and energy efficiency.arXiv preprint arXiv:2408.00741,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.228754Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:7a07282e2d05832266facebd0d7ce3124158e80c3c6dd4301c8584fa785459d4","observation_id":"ff0c436f-f0f8-4b17-8539-95eacae40950","resolution":{"observed_at":"2026-08-07T14:17:13.228754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.807548Z","title":"Mobilebert: A compact task-agnostic BERT for resource-limited devices","venue":null,"work_id":"be7026c6-a6ff-43aa-8bed-5a30584b8301","year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.316281Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:6c5b68eebb22701a7dea84d49e4600cf11285848ee464ab3ed63563e5399c38e","observation_id":"d664f92c-b996-4566-82f9-81bf444e72d0","resolution":{"observed_at":"2026-08-07T14:17:14.858591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T14:17:13.388307Z","title":"[Sunet al., 2023 ] Mingjie Sun, Zhuang Liu, Anna Bair, and J Zico Kolter","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.388307Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:eeddc9bd1714ddbed80afe5fad7588f0ffae559519168a98a3d00e0866851375","observation_id":"13675588-4f3d-41a6-9065-15e4421d2be0","resolution":{"observed_at":"2026-08-07T14:17:13.388307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02019","last_updated":"2023-10-24T17:58:42Z","snapshot_observed_at":"2026-07-06T16:02:19.253303Z","submitted_at":"2023-08-03T20:20:01Z","title":"Baby Llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02019","snapshot_observed_at":"2026-08-07T14:17:13.520349Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2308.02019,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.520349Z"},"links":{"cited_paper":"/paper/2308.02019","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:ba4715313a63e8f76edbf3e8ac45cfeb7233d9d13740ca589b0825bfb947841a","observation_id":"7e41aa38-ff46-4ba9-8ab9-2384f277e640","resolution":{"observed_at":"2026-08-07T14:17:13.520349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:14.639602Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"83206deb-d930-4642-aa51-e5172535b97b","year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.587314Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:a2a282dd9cf16e36de7d76fab7d45d834f5f869cc640fe2d029b0fb770c1bbb0","observation_id":"d2d3d269-a9a6-4263-9a70-464058ce7405","resolution":{"observed_at":"2026-08-07T14:17:14.717813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T14:17:13.649125Z","title":"Wizardlm: Empowering large language models to follow complex instructions.arXiv preprint arXiv:2304.12244,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.649125Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5283b0806db1eba338d0d9a85f0af0ab994338bcca70fab431b8c838aed0d6fa","observation_id":"d9f20b2c-fff4-424d-9f38-361bf038c52f","resolution":{"observed_at":"2026-08-07T14:17:13.649125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13659","last_updated":"2024-07-02T11:57:07Z","snapshot_observed_at":"2026-08-06T16:09:41.701226Z","submitted_at":"2024-02-21T09:45:08Z","title":"Privacy-Preserving Instructions for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13659","snapshot_observed_at":"2026-08-07T14:17:13.709783Z","title":"Privacy-preserving instructions for aligning large language models.arXiv preprint arXiv:2402.13659,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.709783Z"},"links":{"cited_paper":"/paper/2402.13659","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:39680e6028c83ec98b31e74555c5578c1f083f6e36e50d2fc160ab793ed1bf60","observation_id":"68daf60d-6e6b-400a-8df4-ab97fea72bc8","resolution":{"observed_at":"2026-08-07T14:17:13.709783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T14:17:13.776915Z","title":"Llama-adapter: Efficient fine- tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.776915Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:954bd41ff55fe4a18f4aef6b01d852aa1fc91cf2f6a1fdf11603a076ae984d71","observation_id":"6295d597-242a-4e73-80ea-d1236c263649","resolution":{"observed_at":"2026-08-07T14:17:13.776915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-07T14:17:13.851848Z","title":"Tinyllama: An open-source small language model.arXiv preprint arXiv:2401.02385,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.851848Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:a9b753f6b32884a487b739ccaf230c8086e142640267f27aac7d282fc483f360","observation_id":"ebdda103-2ce5-433d-b1b2-a713d540c036","resolution":{"observed_at":"2026-08-07T14:17:13.851848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T14:17:13.922316Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.922316Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:8073a9fe68fdd8e9b351105269cde836f28e7c172123b14ea9d430ca0fe978f8","observation_id":"bd81e855-636f-4768-bbaf-40464cf7f24e","resolution":{"observed_at":"2026-08-07T14:17:13.922316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01323","last_updated":"2024-08-02T15:21:20Z","snapshot_observed_at":"2026-07-06T18:56:05.823411Z","submitted_at":"2024-08-02T15:21:20Z","title":"FANNO: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Only","version":1},"cited_work":{"arxiv_id":"2408.01323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01323","snapshot_observed_at":"2026-08-07T14:17:14.066843Z","title":"FANNO: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Only","venue":"cs.CL","work_id":"6d05b6d6-076f-4820-84ff-5582063e8256","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:13.982716Z"},"links":{"cited_paper":"/paper/2408.01323","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:8ea87426793a5915fa4756fd785682192ce0a821f17ac1c792e676ae25d3d4dc","observation_id":"3149eb77-4ecc-456d-83e6-c3e6e4ed1d8d","resolution":{"observed_at":"2026-08-07T14:17:14.112359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-07T14:17:11.954986Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.954986Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:2ce03681911699bb95fa1d41b8e9fb168c1c3466b1b5f451c58ddcfa1dafd2db","observation_id":"451a2cec-ba0e-445a-b54e-ee7e56ad6f1e","resolution":{"observed_at":"2026-08-07T14:17:11.954986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04004","last_updated":"2024-02-09T01:56:38Z","snapshot_observed_at":"2026-07-06T17:26:14.973632Z","submitted_at":"2024-02-06T13:59:56Z","title":"Understanding the Effect of Noise in LLM Training Data with Algorithmic Chains of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04004","snapshot_observed_at":"2026-08-07T14:17:11.627462Z","title":"Under- standing the effect of noise in llm training data with algo- rithmic chains of thought.arXiv preprint arXiv:2402.04004,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.627462Z"},"links":{"cited_paper":"/paper/2402.04004","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5ebb8ec560ea1d1d5cdd62bf432894ee0ab5db89058d593a32e11a8b38c2cb13","observation_id":"18420bcd-1426-47cd-8f14-8638b35a56f6","resolution":{"observed_at":"2026-08-07T14:17:11.627462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-07T14:17:12.731119Z","title":"Bbq: A hand-built bias benchmark for question answering.arXiv preprint arXiv:2110.08193,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.731119Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:edb5c42f27e727bb8ab7168419784712a6781306fc8656b252ab48abcc133257","observation_id":"412d6c06-8663-4262-a70b-d2b1a3d26820","resolution":{"observed_at":"2026-08-07T14:17:12.731119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:16.315532Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"2fda59f1-19e3-435e-92e6-913a1ea0aaf1","year":2020},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.784482Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:7a9e6ca7015e9bb20a1bb4cf32917d92bae7027ddcd8e652e5c0587f4e2106a6","observation_id":"f13f7814-9cee-49a6-a712-46a252697270","resolution":{"observed_at":"2026-08-07T14:17:16.387650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.206657Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"feb6a0d3-590f-4896-a96b-39e33d218b4b","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.572309Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:0d6c5534bf08b67ddd71fc1c82d0a1dd9b66bcfb323325900947f6654e534253","observation_id":"e5707c30-1294-496b-81ba-f9e3009b34fe","resolution":{"observed_at":"2026-08-07T14:17:17.297578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:15.954176Z","title":"Mini-gemini: Efficient multi-modal models with lightweight vision en- coders.Proceedings of the International Conference on Machine Learning,","venue":null,"work_id":"ab95c304-43a1-43fd-bbf9-847fb8995e4d","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.255383Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:13ef90f3f1b343c3a8d908129e31f6bbcd583764921b8b92765ce4a3cca97844","observation_id":"cc1cdb19-6f44-4ba1-8459-a4663bce7e02","resolution":{"observed_at":"2026-08-07T14:17:16.031243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T14:17:11.481150Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers.arXiv preprint arXiv:2210.17323,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.481150Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:b80e6d700eeffbd7e8e153f6f12c986c9e970587ca6621a0a8c1e612de3c1f63","observation_id":"1b73d8c0-525e-4910-83c4-2e637df2c6c0","resolution":{"observed_at":"2026-08-07T14:17:11.481150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:17.392865Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"d06d818f-b8d6-4da9-a693-87dd9cb7118e","year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.458535Z"},"links":{"citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:c8d4e53e5b063ed04feafbf8d1a283a8d23427fac1d91413c70505edc5b299fe","observation_id":"409ed7a8-8a80-494a-bfd3-2994e99998b5","resolution":{"observed_at":"2026-08-07T14:17:17.457918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02376","last_updated":"2024-06-17T15:02:11Z","snapshot_observed_at":"2026-07-06T18:25:14.248267Z","submitted_at":"2024-06-04T14:53:24Z","title":"Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02376","snapshot_observed_at":"2026-08-07T14:17:11.452316Z","title":"Retaining key information under high compression ra- tios: Query-guided compressor for llms.arXiv preprint arXiv:2406.02376,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:11.452316Z"},"links":{"cited_paper":"/paper/2406.02376","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:e714cad64cff3ff48bea781d88f224f71621996fc427eddb31de07ad450d4c5b","observation_id":"c0ab66cc-894b-4d69-b9e9-54185a6c8210","resolution":{"observed_at":"2026-08-07T14:17:11.452316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T22:25:26.276499Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2505.19529."}