{"as_of":"2026-08-08T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7203292708735e00c1897b54233111fcaa9352ad32145bc40fc6e395303b9540","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:20:23.528274Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05641/citation-record","integrity":"/paper/2506.05641/integrity","json":"/paper/2506.05641/citation-record.json","paper":"/paper/2506.05641"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.314757Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.314757Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:2f6249dddc7ac74d32e8e4f7a80f605ed7e05f949b2367fe71527c6b30927734","observation_id":"6bee9b31-2d7a-411d-aea9-c1326c1eb397","resolution":{"observed_at":"2026-08-07T10:20:23.314757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.207552Z","title":"Hyperstyle: Stylegan inversion with hypernetworks for real image editing","venue":null,"work_id":"220baf7b-11a7-4770-bcaf-00e7ddd2495a","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.320469Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:32be64cf09f624201581426cfb9f057071e700fbe35a23221c6d964b36b0c405","observation_id":"0d953fd4-9338-4c1a-abfe-bfa82963d17e","resolution":{"observed_at":"2026-08-07T10:20:24.212617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.191947Z","title":"Generative pretraining from pixels","venue":null,"work_id":"17b6cee1-4f40-496a-bfac-af13027bf947","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.325266Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:68ec81bc6703dfde6d22e26702659368b60a79db4e32a732d2817c0cadac28d8","observation_id":"916cede7-1b1b-463c-b869-797984d7d730","resolution":{"observed_at":"2026-08-07T10:20:24.196950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.176926Z","title":null,"venue":null,"work_id":"a97080cd-b33d-41cf-ba90-ab342e7506e3","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.330119Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:80ebffeed1c260c6596d3730d1ff2b3f0123e392672666e190030fd45e33f38a","observation_id":"715d2f6c-a967-4153-ac26-594df71f9257","resolution":{"observed_at":"2026-08-07T10:20:24.181790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19135","last_updated":"2025-01-25T00:11:26Z","snapshot_observed_at":"2026-07-06T17:52:22.360870Z","submitted_at":"2024-03-28T04:12:13Z","title":"Streamlining Redundant Layers to Compress Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19135","snapshot_observed_at":"2026-08-07T10:20:23.334815Z","title":"Streamlining redundant layers to compress large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.334815Z"},"links":{"cited_paper":"/paper/2403.19135","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:cbe77111238daa6cbe163f7791ecbafeaa3fc7d37644252897bcffc9b9c9c17a","observation_id":"4cc4256c-a7b8-4d46-9afe-4135f99a4ca6","resolution":{"observed_at":"2026-08-07T10:20:23.334815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11617","last_updated":"2022-10-20T22:23:23Z","snapshot_observed_at":"2026-08-07T22:22:00.309812Z","submitted_at":"2022-10-20T22:23:23Z","title":"Boosting Natural Language Generation from Instructions with Meta-Learning","version":1},"cited_work":{"arxiv_id":"2210.11617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.11617","snapshot_observed_at":"2026-08-07T10:20:23.929048Z","title":"Boosting Natural Language Generation from Instructions with Meta-Learning","venue":"cs.CL","work_id":"6bb1e03c-91ce-4787-8dcf-bb163b3d0e9f","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.340824Z"},"links":{"cited_paper":"/paper/2210.11617","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:1848361abdbdb13e6468685c7a3dff518e7876ffb2342ddaf3b1a186e91ab8e3","observation_id":"275a067c-b886-4fd5-ae53-c8023bd7de5b","resolution":{"observed_at":"2026-08-07T10:20:23.934119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.346680Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.346680Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:237ea04d1e577af1b47b0a019242306f4ba5b9a8cd95770bcd4950bc12e4f389","observation_id":"d699fe1f-2075-47aa-898e-b4be65cea802","resolution":{"observed_at":"2026-08-07T10:20:23.346680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.161716Z","title":"M., Tran, A","venue":null,"work_id":"eb49ec26-9d40-4fe9-b471-a33026cb9074","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.352660Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:3e4c56d2085832629c3b508961f4a112745ce065d17aae8f9413b29a16e49073","observation_id":"b893d2be-ada6-4e84-9d62-fa5cbdf9b7b3","resolution":{"observed_at":"2026-08-07T10:20:24.166641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.09106","last_updated":"2016-12-01T10:08:15Z","snapshot_observed_at":"2026-07-06T05:12:38.024970Z","submitted_at":"2016-09-27T05:57:00Z","title":"HyperNetworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.09106","snapshot_observed_at":"2026-08-07T10:20:23.357151Z","title":"M., and Le, Q","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.357151Z"},"links":{"cited_paper":"/paper/1609.09106","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:828114fc2b37922d9854ee466654f7fdb5776a27053d7be74bb9a384ae394264","observation_id":"7a8ead0f-a2de-40b5-9a6a-d8562cdae8d8","resolution":{"observed_at":"2026-08-07T10:20:23.357151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.362579Z","title":"Hyperprompt: Prompt-based task-conditioning of transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.362579Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:aa260ed16e8ae2dca529d2d2a65406cef32b52164be330b2194f25cd22ce9ddd","observation_id":"5d7068fc-e95b-4a07-a3c5-91f7637e81c9","resolution":{"observed_at":"2026-08-07T10:20:23.362579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08304","last_updated":"2022-10-18T17:37:56Z","snapshot_observed_at":"2026-07-06T12:48:20.464521Z","submitted_at":"2022-03-15T22:39:53Z","title":"Hyperdecoders: Instance-specific decoders for multi-task NLP","version":3},"cited_work":{"arxiv_id":"2203.08304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08304","snapshot_observed_at":"2026-08-07T10:20:23.818141Z","title":"Hyperdecoders: Instance-specific decoders for multi-task NLP","venue":"cs.CL","work_id":"06fb934e-34d9-436a-973e-ccca9f0f99a4","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.367230Z"},"links":{"cited_paper":"/paper/2203.08304","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:61e93adaf0dfb33d713836d650b04aa15ddab4ceff05c6b06c1336a0aad7d724","observation_id":"cf7bb954-6bd5-489c-9a54-29b05de8df58","resolution":{"observed_at":"2026-08-07T10:20:23.823298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10315","last_updated":"2023-05-24T22:30:30Z","snapshot_observed_at":"2026-07-06T14:32:59.739845Z","submitted_at":"2022-12-20T15:07:37Z","title":"HINT: Hypernetwork Instruction Tuning for Efficient Zero- & Few-Shot Generalisation","version":2},"cited_work":{"arxiv_id":"2212.10315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10315","snapshot_observed_at":"2026-08-07T10:20:23.797803Z","title":"HINT: Hypernetwork Instruction Tuning for Efficient Zero- & Few-Shot Generalisation","venue":"cs.CL","work_id":"aae964cb-8567-49ab-8842-f0385bbad7ed","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.372648Z"},"links":{"cited_paper":"/paper/2212.10315","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:14405e566027298087e777d2501f57e93bb5ae8d7a378c457b53039fbc83004a","observation_id":"43eac6e2-e438-441b-a128-46d665c518d1","resolution":{"observed_at":"2026-08-07T10:20:23.802443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.377682Z","title":"Scaling up gans for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.377682Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:24d37cbf83de9de7ae716c69e2399b975ba80271e26a96e9b72f5019aa2d1cf4","observation_id":"86b4b6db-6770-48ab-86ef-a2137cca3ae3","resolution":{"observed_at":"2026-08-07T10:20:23.377682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.128687Z","title":"W., and Romero Soriano, A","venue":null,"work_id":"b245ddb7-c768-498b-8b4e-b8ca4d888b57","year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.382346Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:d7f290609bf3b34c1195f49d4b34a0d6e9d1baf1094f7d22dcffd80c76d03e01","observation_id":"de91b97f-d021-438a-984d-7936166ea8a4","resolution":{"observed_at":"2026-08-07T10:20:24.133499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06914","last_updated":"2024-03-12T15:52:14Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T17:03:04Z","title":"MEND: Meta dEmonstratioN Distillation for Efficient and Effective In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06914","snapshot_observed_at":"2026-08-07T10:20:23.386981Z","title":"Mend: Meta demonstration distillation for efficient and effective in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.386981Z"},"links":{"cited_paper":"/paper/2403.06914","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:2703aa804c888945d64f6bd0c560bba3372a9cd291a0ecf641e6f26ee5effd8f","observation_id":"21e1d121-5618-406f-ad35-ba98fc176130","resolution":{"observed_at":"2026-08-07T10:20:23.386981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.113644Z","title":"Hart: Efficient adaptation via regularized autoregressive parameter generation","venue":null,"work_id":"9695af1c-3e16-423c-8fe3-7f5910787567","year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.392191Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:5f3a6abd2cfb2de3ae4598ce15573e40d689fd6b67377518ca93c08742c40fd2","observation_id":"2a602a46-a976-471e-9d45-cffde6b3741a","resolution":{"observed_at":"2026-08-07T10:20:24.118920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09152","last_updated":"2021-07-19T04:37:21Z","snapshot_observed_at":"2026-07-06T09:57:00.292530Z","submitted_at":"2020-09-19T03:23:26Z","title":"Weight Distillation: Transferring the Knowledge in Neural Network Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09152","snapshot_observed_at":"2026-08-07T10:20:23.397051Z","title":"Weight distillation: Transferring the knowledge in neural network parameters","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.397051Z"},"links":{"cited_paper":"/paper/2009.09152","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:fa6c112e1b196bdf1017787b2b0fa9bf77a229b34df68d9fa850e9f958eb2ccd","observation_id":"7543a2fd-2b45-4c67-a734-077fe83da26d","resolution":{"observed_at":"2026-08-07T10:20:23.397051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.098710Z","title":"and Wolf, L","venue":null,"work_id":"45a64f27-16cf-4fc1-b029-efc6f6c42e0c","year":2019},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.401458Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:82db5622a8edf6e0392eb74b4759e52539ac1c2c0b791e3362d083a588681901","observation_id":"1995b6ab-1e12-460f-bfa4-9baa28950a70","resolution":{"observed_at":"2026-08-07T10:20:24.104202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11627","last_updated":"2023-09-28T03:59:27Z","snapshot_observed_at":"2026-07-06T15:29:39.466936Z","submitted_at":"2023-05-19T12:10:53Z","title":"LLM-Pruner: On the Structural Pruning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11627","snapshot_observed_at":"2026-08-07T10:20:23.406830Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.406830Z"},"links":{"cited_paper":"/paper/2305.11627","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:154046e5adc6b6de27d8960d7d842fe7fecd6e4cc6eaa4ae7145ab932bb7b1b4","observation_id":"7be6e0e3-43ae-4cf7-91b1-9025df43c6bd","resolution":{"observed_at":"2026-08-07T10:20:23.406830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04489","last_updated":"2021-06-08T16:16:40Z","snapshot_observed_at":"2026-08-03T19:17:21.128233Z","submitted_at":"2021-06-08T16:16:40Z","title":"Parameter-efficient Multi-task Fine-tuning for Transformers via Shared Hypernetworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04489","snapshot_observed_at":"2026-08-07T10:20:23.411520Z","title":"K., Ruder, S., Dehghani, M., and Henderson, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.411520Z"},"links":{"cited_paper":"/paper/2106.04489","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:a28f0d7bfb0a6e30587fd2d30bdd5f1e5807aa67e15d067df334f44bb55d9e9c","observation_id":"4e24ea5f-34e9-46ab-b714-0d79f5411bd6","resolution":{"observed_at":"2026-08-07T10:20:23.411520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.416110Z","title":"Learning to compress prompts with gist tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.416110Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:db75a5eeaab6f047e4a68bff2ebd3dfe59824795a597203f741c03e7dd03fb9c","observation_id":"5a6f7cea-f05d-48be-bcb6-273463a35af1","resolution":{"observed_at":"2026-08-07T10:20:23.416110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.075443Z","title":"Hyperseg: Patch-wise hypernetwork for real-time semantic segmentation","venue":null,"work_id":"29d8846a-f82f-4c85-9952-278858e366f4","year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.420255Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:24547148f90e50694339a8a8a810fcc510af7ebf9ace00d30f13387c177c27d4","observation_id":"6e90fde6-bde9-4a93-af25-d3cb7c3e90e9","resolution":{"observed_at":"2026-08-07T10:20:24.079707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16817","last_updated":"2024-02-26T18:42:26Z","snapshot_observed_at":"2026-08-07T16:10:48.105492Z","submitted_at":"2024-02-26T18:42:26Z","title":"Investigating the Effectiveness of HyperTuning via Gisting","version":1},"cited_work":{"arxiv_id":"2402.16817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16817","snapshot_observed_at":"2026-08-07T10:20:23.734202Z","title":"Investigating the Effectiveness of HyperTuning via Gisting","venue":"cs.CL","work_id":"cfe9460b-0937-4502-aac8-d99412f1fc70","year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.425212Z"},"links":{"cited_paper":"/paper/2402.16817","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:a20d85a53d9f3e4ff18e6b16f5ee1af39b9a87db4cc8eba0e7491f769188fdc3","observation_id":"18a11af9-940f-4006-aff5-4dc8e24ac5b9","resolution":{"observed_at":"2026-08-07T10:20:23.740739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.061081Z","title":"Hypertuning: Toward adapting large language models without back-propagation","venue":null,"work_id":"b70632c0-3e1c-4d1f-8b13-cb2610bebc78","year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.429853Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:57acb62caca65d8c6270eede78c66338ac275d02487f5d89ee76fcfd006bd92b","observation_id":"fda714b2-9a56-44bc-8f33-d90ac59faf0c","resolution":{"observed_at":"2026-08-07T10:20:24.066240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.434658Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.434658Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:47d5c2e7c2fd9e537fd8ba3836dc5ea7b35a8cdeb9bb1eb17fe6a638dafe9e2e","observation_id":"5d23275c-0f2c-41db-aa97-77714cb430f8","resolution":{"observed_at":"2026-08-07T10:20:23.434658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.438991Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.438991Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:43636090aa17fde843d675675f778350d4feb94485a223aecf64d622222e6535","observation_id":"e0fbae4a-22a1-4de7-aef7-a07c02a75157","resolution":{"observed_at":"2026-08-07T10:20:23.438991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.443960Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.443960Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:dbaab669eadb952eb99273ca9f3b146ba1b70654716b1705d03645e53ebb2ea3","observation_id":"11cb2282-9177-43e1-985b-80f56214a114","resolution":{"observed_at":"2026-08-07T10:20:23.443960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09299","last_updated":"2023-12-14T19:08:56Z","snapshot_observed_at":"2026-07-06T17:02:05.607732Z","submitted_at":"2023-12-14T19:08:56Z","title":"Weight subcloning: direct initialization of transformers using larger pretrained ones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09299","snapshot_observed_at":"2026-08-07T10:20:23.449360Z","title":"Weight subcloning: direct initialization of transformers using larger pretrained ones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.449360Z"},"links":{"cited_paper":"/paper/2312.09299","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:66984ead74c1227b5790396760fed6b4a2621c2628fd4e4265e8e658719cf07d","observation_id":"e7114082-f259-48a8-87f8-7a48ba4fbcec","resolution":{"observed_at":"2026-08-07T10:20:23.449360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.019862Z","title":"Implicit neural representations with periodic activation functions","venue":null,"work_id":"a55c3121-a867-45b1-9eb6-47d7ff623ab5","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.454384Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:76c6f31ccfdb2a80967f81b63f9da05082cfcc9191ba75cff774eb4c7bbd8da9","observation_id":"8fedaeba-9c02-41dc-bbb2-d6558d894bd0","resolution":{"observed_at":"2026-08-07T10:20:24.024695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.006383Z","title":"K., Tabor, J., Trzci \\'n ski, T., et al","venue":null,"work_id":"96031728-ff05-43d1-ae08-e30b0e983b53","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.459631Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:334565907e3bc4290c9288407810bea82009f4c2b1b4aba1b796fc29e74ef0e3","observation_id":"ee564d52-2cc6-430b-982e-d0a93c16ee8e","resolution":{"observed_at":"2026-08-07T10:20:24.010760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04317","last_updated":"2024-11-04T13:02:33Z","snapshot_observed_at":"2026-07-06T17:40:54.163034Z","submitted_at":"2024-03-07T08:34:57Z","title":"Online Adaptation of Language Models with a Memory of Amortized Contexts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04317","snapshot_observed_at":"2026-08-07T10:20:23.464106Z","title":"W., and Schwarz, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.464106Z"},"links":{"cited_paper":"/paper/2403.04317","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:0fae3a0a3de37fe0b69445d5935d46d231380f5684697f480e30d27fb4a7779c","observation_id":"9a85040c-d887-405b-933e-432fe6ffff29","resolution":{"observed_at":"2026-08-07T10:20:23.464106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05964","last_updated":"2024-04-07T13:03:58Z","snapshot_observed_at":"2026-07-06T17:27:37.212340Z","submitted_at":"2024-02-05T12:16:28Z","title":"A Survey on Transformer Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05964","snapshot_observed_at":"2026-08-07T10:20:23.468653Z","title":"A survey on transformer compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.468653Z"},"links":{"cited_paper":"/paper/2402.05964","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:0450ba038c3828d97e420e20574c0ea058ed032932593adae3bcee54bdb49849","observation_id":"dcd730a1-9d8a-4eb8-909d-20fbf5061899","resolution":{"observed_at":"2026-08-07T10:20:23.468653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.991677Z","title":"Hypergrid transformers: Towards a single model for multiple tasks","venue":null,"work_id":"257adb63-cbfb-4785-a332-cc1c4239b9e5","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.474236Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:d0c662bf1f80d1263ab8020e8dd4820b1303fbe59ce59b2c2a7c632fa96ca5f7","observation_id":"c39bb78e-fb8c-454e-835d-73e4588b7c42","resolution":{"observed_at":"2026-08-07T10:20:23.996889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.478703Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.478703Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:b93f5fae0a6ef53d20dfbb28d10e8a867194e13e199382657a972593a7489f7a","observation_id":"32d1dfa4-b204-442a-bc48-ab1ce2b3b453","resolution":{"observed_at":"2026-08-07T10:20:23.478703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.968105Z","title":"Example-based hypernetworks for multi-source adaptation to unseen domains","venue":null,"work_id":"43e907c6-7144-4128-87e7-dd658d28b822","year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.483346Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:6b793f66244dd3af8c27fb064eed56e9a0db528a464c4a31d12e5337949feb9a","observation_id":"cbfe6837-2078-4eca-9805-9b989624ca24","resolution":{"observed_at":"2026-08-07T10:20:23.972941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00695","last_updated":"2022-04-11T14:58:15Z","snapshot_observed_at":"2026-08-06T22:48:15.827343Z","submitted_at":"2019-06-03T10:45:08Z","title":"Continual learning with hypernetworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00695","snapshot_observed_at":"2026-08-07T10:20:23.488791Z","title":"F., and Sacramento, J","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.488791Z"},"links":{"cited_paper":"/paper/1906.00695","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:ca98bd4fb7c56cccd29eb7a9a826c3b33069e68d2ce51d24722bc07cdc49eb09","observation_id":"683114a4-2df1-4d58-8ce5-d93720fcb929","resolution":{"observed_at":"2026-08-07T10:20:23.488791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02279","last_updated":"2023-06-29T14:04:26Z","snapshot_observed_at":"2026-08-01T12:20:53.734135Z","submitted_at":"2023-05-03T17:15:58Z","title":"Learngene: Inheriting Condensed Knowledge from the Ancestry Model to Descendant Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02279","snapshot_observed_at":"2026-08-07T10:20:23.493636Z","title":"Learngene: Inheriting condensed knowledge from the ancestry model to descendant models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.493636Z"},"links":{"cited_paper":"/paper/2305.02279","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:36f4161b73b5591211bd4aa691952f839bb2caf8728d66c745f4b3c1eff9b9a5","observation_id":"9da367a4-6e4d-4f94-906e-d6db61245e1d","resolution":{"observed_at":"2026-08-07T10:20:23.493636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09748","last_updated":"2024-02-15T06:58:30Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T06:58:30Z","title":"Model Compression and Efficient Inference for Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09748","snapshot_observed_at":"2026-08-07T10:20:23.498590Z","title":"Model compression and efficient inference for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.498590Z"},"links":{"cited_paper":"/paper/2402.09748","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:5b480875dc0fa0c5fa9481c79c7c5e4c6e1407d85b2eeaf9ebbea4bf80e4ef08","observation_id":"672c3344-f7a9-49ba-95cb-9c901ddbcfe5","resolution":{"observed_at":"2026-08-07T10:20:23.498590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-07T03:20:22.127593Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-07T10:20:23.503135Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.503135Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:e572506b5a9ca41ab057656683d3dd230f6f75f6c020ce4b5c852af8212a9e37","observation_id":"ae4335e1-87c5-4a7d-b29c-32a55d66cbc2","resolution":{"observed_at":"2026-08-07T10:20:23.503135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18823","last_updated":"2023-11-30T18:58:26Z","snapshot_observed_at":"2026-07-06T16:55:13.127567Z","submitted_at":"2023-11-30T18:58:26Z","title":"Initializing Models with Larger Ones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18823","snapshot_observed_at":"2026-08-07T10:20:23.507736Z","title":"Initializing models with larger ones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.507736Z"},"links":{"cited_paper":"/paper/2311.18823","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:fc329333da8f635d6a9951ddc768f25baa63a9f54e7613782fe3ffaab2596ed4","observation_id":"0d68f145-6488-44c9-aefe-85cb92153452","resolution":{"observed_at":"2026-08-07T10:20:23.507736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00420","last_updated":"2021-06-15T05:50:01Z","snapshot_observed_at":"2026-08-04T06:36:20.005516Z","submitted_at":"2021-01-02T10:50:23Z","title":"Learning to Generate Task-Specific Adapters from Task Description","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00420","snapshot_observed_at":"2026-08-07T10:20:23.512717Z","title":"and Ren, X","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.512717Z"},"links":{"cited_paper":"/paper/2101.00420","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:29caaeee26b788fa47112ef9c27e99c072f119acb1863f7d43c1907bd67bb665","observation_id":"5c73e39c-e67a-4057-8758-4ba43943c7b7","resolution":{"observed_at":"2026-08-07T10:20:23.512717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05749","last_updated":"2020-12-18T18:01:04Z","snapshot_observed_at":"2026-07-06T07:07:47.487337Z","submitted_at":"2018-10-12T22:21:05Z","title":"Graph HyperNetworks for Neural Architecture Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05749","snapshot_observed_at":"2026-08-07T10:20:23.517790Z","title":"Graph hypernetworks for neural architecture search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.517790Z"},"links":{"cited_paper":"/paper/1810.05749","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:c0478673c283b4dc9ad0276ecb8284afd934cb495d2f92429bbdd925b7128851","observation_id":"84fcaa74-7a48-4441-b0e1-242d3319bb33","resolution":{"observed_at":"2026-08-07T10:20:23.517790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.522276Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.522276Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:15ce75e567ecf94ff2b1a17726d562325d1af29e3cdc1802782890235b0ce5be","observation_id":"da0e948b-b922-44f4-97a2-54290bd35183","resolution":{"observed_at":"2026-08-07T10:20:23.522276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12656","last_updated":"2024-07-25T06:28:01Z","snapshot_observed_at":"2026-07-06T17:32:36.489908Z","submitted_at":"2024-02-20T02:09:55Z","title":"HyperMoE: Towards Better Mixture of Experts via Transferring Among Experts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12656","snapshot_observed_at":"2026-08-07T10:20:23.528274Z","title":"Hypermoe: Towards better mixture of experts via transferring among experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.528274Z"},"links":{"cited_paper":"/paper/2402.12656","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:34e17348c847563e95fc8bf7d91cd96b59ad2e8c74d00d69962c86855681dc0a","observation_id":"0ebd817a-a2be-47aa-8a36-9740174c8161","resolution":{"observed_at":"2026-08-07T10:20:23.528274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:21:58.673015Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":4,"verified_fuzzy":12},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.05641."}