{"as_of":"2026-08-11T20:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:716f75f28065527a75d361da1a03d91e259a779b1f50631f1457484900ecf062","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:38:28.057837Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:10:23.224012Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:15:47.100825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"cited_work":{"arxiv_id":"2501.16273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16273","snapshot_observed_at":"2026-07-01T14:15:47.100825Z","title":"Return of the encoder: Maximizing parameter efficiency for slms","venue":null,"work_id":"9c582ca4-b158-4a1a-8bcd-d94999137f74","year":2025},"citing_paper":{"arxiv_id":"2605.18807","last_updated":"2026-05-29T16:33:13Z","snapshot_observed_at":"2026-08-09T23:10:43.266999Z","submitted_at":"2026-05-11T22:41:03Z","title":"Block-Based Double Decoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T22:05:25.465669Z"},"links":{"cited_paper":"/paper/2501.16273","citing_paper":"/paper/2605.18807"},"observation_digest":"sha256:9eb1be2e2096250d471da7e254e2fe2d13cbd6f3c88f0a1b4f337677b4093d02","observation_id":"70c5d87b-8440-42fe-ac72-f6d6c92d2fcb","resolution":{"observed_at":"2026-05-20T22:09:07.410647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"cited_work":{"arxiv_id":"2501.16273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16273","snapshot_observed_at":"2026-07-01T14:15:47.100825Z","title":"Return of the encoder: Maximizing parameter efficiency for slms","venue":null,"work_id":"9c582ca4-b158-4a1a-8bcd-d94999137f74","year":2025},"citing_paper":{"arxiv_id":"2605.18807","last_updated":"2026-05-29T16:33:13Z","snapshot_observed_at":"2026-08-09T23:10:43.266999Z","submitted_at":"2026-05-11T22:41:03Z","title":"Block-Based Double Decoders","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T22:10:23.224012Z"},"links":{"cited_paper":"/paper/2501.16273","citing_paper":"/paper/2605.18807"},"observation_digest":"sha256:248d5dc95888af8eaeae9f3580549f8e5eb6950a5e1ee0f0123b099fd4fd64c5","observation_id":"e1f51838-efd0-4eea-8986-fc09bd439fb2","resolution":{"observed_at":"2026-07-01T14:15:47.102233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16273/citation-record","integrity":"/paper/2501.16273/integrity","json":"/paper/2501.16273/citation-record.json","paper":"/paper/2501.16273"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T13:38:27.618507Z","title":"A., Bach, N., Bahree, A., Bakhtiari, A., Bao, J., Behl, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.618507Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:6eab2cc31e6bc63fdd6a569cab6b9cf55b880748b82d45d2a70ddcabcdeaa454","observation_id":"26224014-6e59-499f-9ff4-ed9180e2a448","resolution":{"observed_at":"2026-08-10T13:38:27.618507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-10T13:38:27.633491Z","title":"L., and Zou, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.633491Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:ca68988fa7f6cfa741183144fd5d095a8c85671af84034abd950956447bd568d","observation_id":"39102d7a-7538-4164-b0dd-b09ee001a983","resolution":{"observed_at":"2026-08-10T13:38:27.633491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04757","last_updated":"2023-06-15T05:08:56Z","snapshot_observed_at":"2026-08-11T03:52:09.829841Z","submitted_at":"2023-06-07T20:12:29Z","title":"INSTRUCTEVAL: Towards Holistic Evaluation of Instruction-Tuned Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04757","snapshot_observed_at":"2026-08-10T13:38:27.640022Z","title":"K., Hong, P., Bing, L., and Poria, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.640022Z"},"links":{"cited_paper":"/paper/2306.04757","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:fa6036e66420886bfad467112165e369a85a7cb33f1ff7c118eafb6f39d3ce4a","observation_id":"4bc5289b-6507-4522-9fc0-97598ee1e331","resolution":{"observed_at":"2026-08-10T13:38:27.640022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:28.415130Z","title":"Ac- cessed: 2024-12-03","venue":null,"work_id":"6ccd59d7-ecee-4d29-aa23-9fa5409f3830","year":2024},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.645890Z"},"links":{"citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:4e5303a09fc1cd31ca5afc43ec458d58dc93063d9927720903ae43820fbc6c04","observation_id":"0574b36f-9b83-47d7-8357-6fbe25aee5b7","resolution":{"observed_at":"2026-08-10T13:38:28.421010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T13:38:27.654581Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.654581Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:beadf69ee8b811c0bd6d84583ad43b45c5658f6e4abc4270b7aff9eca9625bc2","observation_id":"04b5dde0-32b4-408c-b608-84da0cec4073","resolution":{"observed_at":"2026-08-10T13:38:27.654581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04052","last_updated":"2023-04-08T15:44:29Z","snapshot_observed_at":"2026-08-10T11:58:13.376663Z","submitted_at":"2023-04-08T15:44:29Z","title":"Decoder-Only or Encoder-Decoder? Interpreting Language Model as a Regularized Encoder-Decoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04052","snapshot_observed_at":"2026-08-10T13:38:27.658582Z","title":"M.-C., Hu, S., Liu, Z., and Collier, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.658582Z"},"links":{"cited_paper":"/paper/2304.04052","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:dd3b48394e7f8b9c1450226708218aee692fe619dadb1b4660f2eb13fcc1ad89","observation_id":"3a42d37d-a6be-4ed0-b700-fc68eb4689ae","resolution":{"observed_at":"2026-08-10T13:38:27.658582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-10T13:38:27.667277Z","title":"Accessed: 2024- 12-07","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.667277Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:1dc1333c8cc614a8b2ee1c52ca63e06ddba555e0fda4763b4921a750218e13a9","observation_id":"860103bb-2346-4c4e-b29c-94292f139bb6","resolution":{"observed_at":"2026-08-10T13:38:27.667277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T13:38:27.677382Z","title":"Kaplan, J., McCandlish, S., Henighan, T., Brown, T","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.677382Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:e817a46d33dd0de06a5ed4960e86ae81782ab8471630078f4f854b6549e3b52d","observation_id":"4916d070-f6f0-4d1a-876e-21413d99d144","resolution":{"observed_at":"2026-08-10T13:38:27.677382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T13:38:27.692002Z","title":"Llava- onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.692002Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:476d3a2df2cd2229fefd0181713d6a7fb65d107e60234b18615cac7214d8ac0f","observation_id":"8a0cea23-b7f3-4ccd-b990-e06dc059f830","resolution":{"observed_at":"2026-08-10T13:38:27.692002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-07T05:13:11.135540Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-10T13:38:27.716134Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.716134Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:c249270f6517c6db916f6c64ac5b8df1bd8d9c13a95a899d7b2b7e03c2f41cd7","observation_id":"20e568c4-5f26-4f09-b65a-8f35445eb1b1","resolution":{"observed_at":"2026-08-10T13:38:27.716134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08745","last_updated":"2018-08-27T09:08:18Z","snapshot_observed_at":"2026-07-06T06:57:36.335954Z","submitted_at":"2018-08-27T09:08:18Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.08745","snapshot_observed_at":"2026-08-10T13:38:27.774038Z","title":"B., and Lapata, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.774038Z"},"links":{"cited_paper":"/paper/1808.08745","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:94019ddc62d697710999932c2414689e4abc18619ea968b63b454ea065c4a4db","observation_id":"7e263b7b-3b62-4e4b-9372-4fb3c9971383","resolution":{"observed_at":"2026-08-10T13:38:27.774038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-10T13:38:27.853229Z","title":"Radford, A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.853229Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:83a9847bd7053696809a4605b9fcc169e8d98cc967b35b1c9141ac93ea44a24c","observation_id":"0d214534-5a56-42b8-889e-2a214b56329e","resolution":{"observed_at":"2026-08-10T13:38:27.853229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-10T13:38:27.895019Z","title":"Squad: 100,000+ questions for machine com- prehension of text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.895019Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:54208db9ca06846ce0ea0b5458e3d531faf23fdb4981baa585fea34a50194bfa","observation_id":"918da488-a28e-4a42-a05e-5f0f5bfc66dc","resolution":{"observed_at":"2026-08-10T13:38:27.895019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11796","last_updated":"2024-12-09T18:31:01Z","snapshot_observed_at":"2026-08-07T10:56:20.468878Z","submitted_at":"2024-08-21T17:38:48Z","title":"LLM Pruning and Distillation in Practice: The Minitron Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11796","snapshot_observed_at":"2026-08-10T13:38:27.986967Z","title":"T., Muralidharan, S., Joshi, R., Chochowski, M., Patwary, M., Shoeybi, M., Catanzaro, B., Kautz, J., and Molchanov, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.986967Z"},"links":{"cited_paper":"/paper/2408.11796","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:771432a929eea138ee2bb90edc22dfabd6c276fc633f61811ede315693b72037","observation_id":"dd10b5a4-4b1e-41af-b476-84f953126fb2","resolution":{"observed_at":"2026-08-10T13:38:27.986967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12672","last_updated":"2022-02-23T09:17:28Z","snapshot_observed_at":"2026-08-03T14:02:38.344367Z","submitted_at":"2021-06-23T22:24:14Z","title":"Charformer: Fast Character Transformers via Gradient-based Subword Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.12672","snapshot_observed_at":"2026-08-10T13:38:28.002150Z","title":"Tay, Y ., Tran, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:28.002150Z"},"links":{"cited_paper":"/paper/2106.12672","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:6279768e832e5681283b2dfbe7d8fb55bd18752d5d9e46b5b04bea7956734b59","observation_id":"9b132740-e8ad-4d13-8ac0-72b6c1cf485c","resolution":{"observed_at":"2026-08-10T13:38:28.002150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05131","last_updated":"2023-02-28T17:20:36Z","snapshot_observed_at":"2026-08-08T23:22:00.655876Z","submitted_at":"2022-05-10T19:32:20Z","title":"UL2: Unifying Language Learning Paradigms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05131","snapshot_observed_at":"2026-08-10T13:38:28.033474Z","title":"Q., Garcia, X., Wei, J., Wang, X., Chung, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:28.033474Z"},"links":{"cited_paper":"/paper/2205.05131","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:43aceceb08823f4c10efdc84bb5595784b0a4261eedff692ab1872574bee1923","observation_id":"c19c6b60-fe5f-41c4-9879-21d4ce68723f","resolution":{"observed_at":"2026-08-10T13:38:28.033474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-07-06T16:29:23.853368Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-10T13:38:28.057837Z","title":"Ureader: Uni- versal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:28.057837Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:6eea7e4096b51d49d27880763989e626ce194352909748a0efd2f9c2607f609c","observation_id":"2354dc82-88e1-4cb8-ac30-81994c8141c4","resolution":{"observed_at":"2026-08-10T13:38:28.057837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-10T13:38:27.686877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.686877Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:30109a4bf81a9bef7dae19920ffcddb2cc7bac8ade0651c3d0a2dfc7ecc47216","observation_id":"bcf99257-75dc-4a7c-88c3-3b6899d5a85c","resolution":{"observed_at":"2026-08-10T13:38:27.686877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01744","last_updated":"2025-06-06T17:53:30Z","snapshot_observed_at":"2026-08-09T18:09:04.551754Z","submitted_at":"2024-10-02T16:55:01Z","title":"Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01744","snapshot_observed_at":"2026-08-10T13:38:27.672939Z","title":"Leopard: A vision language model for text-rich multi-image tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.672939Z"},"links":{"cited_paper":"/paper/2410.01744","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:ed81ec9cc02ea0423eaef56af6f8ea1d7d7869760fdeb13cd6c1c87cd61659be","observation_id":"10f5ad3a-bd31-4614-88e5-427928a0db58","resolution":{"observed_at":"2026-08-10T13:38:27.672939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:27.682361Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.682361Z"},"links":{"citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:aeed2b843b6506965f00659308256e17f5c667182bd847b30ea3d5bde535e6e9","observation_id":"8b582178-3ac7-4036-b10c-542a137f2710","resolution":{"observed_at":"2026-08-10T13:38:27.682361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T13:38:27.746902Z","title":"X., Tan, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.746902Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:4b162ec2af9a9eb74114a5de0cf2d693a8f1a7394e96c709b06b7f9815f2440f","observation_id":"4522d759-17c6-4836-8c3a-f1350145ad67","resolution":{"observed_at":"2026-08-10T13:38:27.746902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T13:38:27.623720Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.623720Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:da657453f71c4738d03d2f29e73620a2c07c71a46e0fc6dc217e5db6b8380d1f","observation_id":"9fea0d00-e042-4752-a35d-c7fa773bbf69","resolution":{"observed_at":"2026-08-10T13:38:27.623720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-10T13:38:27.628521Z","title":"M., Firat, O., Johnson, M., Lepikhin, D., Passos, A., Shakeri, S., Taropa, E., Bailey, P., Chen, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.628521Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:b66bce8cf792191f961c668bffc9988f3b304be234a69f915edd2be597cda56a","observation_id":"cf833cf1-b7b3-4124-b642-406d21bf1be6","resolution":{"observed_at":"2026-08-10T13:38:27.628521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T13:38:28.044203Z","title":"Llama: Open and efficient foundation lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:28.044203Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:13bd17abcd3043cd7ceb5010a16026b903f63635d46840be156c3e475dc56a28","observation_id":"86b1c4e8-768d-40b0-ac58-b6741e04e5f2","resolution":{"observed_at":"2026-08-10T13:38:28.044203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2501.16273."}