{"as_of":"2026-08-07T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34b62d613d71109f6ad664a64ba16c7596ffdfff6aafb999e16c1316a345ba5f","coverage":[{"denominator":182,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:06:51.147174Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19795/citation-record","integrity":"/paper/2507.19795/integrity","json":"/paper/2507.19795/citation-record.json","paper":"/paper/2507.19795"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-06T14:06:46.655990Z","title":"Semdedup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.655990Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:50dcd62b18b67c74d76c3fd3e8fac74ba44a311f20dc74129d51b5bbb2905044","observation_id":"070c60c3-5d12-491b-9f6c-e83e702dd58f","resolution":{"observed_at":"2026-08-06T14:06:46.655990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.696576Z","title":"Dbpedia: A nucleus for a web of open data","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.696576Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8b95110ebe14628f535e24442a1c32d8a21cae7bd6ef0eb99b2e979af8b9fa64","observation_id":"a759c726-2c8d-4e10-8f58-ebadc4394e3a","resolution":{"observed_at":"2026-08-06T14:06:46.696576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.715625Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.715625Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f04770cb01e0206835b570524e5e36649ff9ddffe4b289652e8ce08f0ff6dd6b","observation_id":"6c0ac0c8-8591-41fb-96bb-39f89a606437","resolution":{"observed_at":"2026-08-06T14:06:46.715625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.755360Z","title":"Distilling the knowledge from conditional normalizing flows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.755360Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f8c859a635f7a0deb050fc8ed87004703b26616487b2a4f88e122b0b7f56cd68","observation_id":"089fca25-278d-4ce5-a8b0-bbc58350984d","resolution":{"observed_at":"2026-08-06T14:06:46.755360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.795478Z","title":"Semantic photo manipulation with a generative image prior","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.795478Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d4fbe736fa24d424fd9599453a69190286be91eab1d445ced7d4744104d150de","observation_id":"ec860435-881d-4b73-96f4-c89e0b03798b","resolution":{"observed_at":"2026-08-06T14:06:46.795478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.808841Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.808841Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c0ae1157abbf635126d48cf5fed300fddfa1f5508a5a2351651815d6815b7bb6","observation_id":"7bd85612-fb82-49a4-b209-616fdea7f9e8","resolution":{"observed_at":"2026-08-06T14:06:46.808841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T14:06:46.853428Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.853428Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:6a53e01e5ffdaef819737a54f0b4423f8dcb3138f546a50256361bae5ea689c0","observation_id":"1a147371-7cbd-4c61-8baa-4ef2a26f1f0d","resolution":{"observed_at":"2026-08-06T14:06:46.853428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05649","last_updated":"2019-02-20T18:36:23Z","snapshot_observed_at":"2026-07-06T06:28:23.520382Z","submitted_at":"2018-03-15T09:15:14Z","title":"Sylvester Normalizing Flows for Variational Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05649","snapshot_observed_at":"2026-08-06T14:06:46.903070Z","title":"Tomczak, and Max Welling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.903070Z"},"links":{"cited_paper":"/paper/1803.05649","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a4b39f19b19c44456c11a82c52df5bfca2d6eb153f88a926b347e7cf898aeb54","observation_id":"b09a2656-3a25-493b-bad9-05d54049a079","resolution":{"observed_at":"2026-08-06T14:06:46.903070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.962524Z","title":"Unleashing transformers: Parallel token prediction with discrete absorbing diffusion for fast high-resolution image generation from vector-quantized codes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.962524Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8fa1c7de990d0e2f9d85d97817d0d16ed48599c8fba8c9773fa951ebb282ff58","observation_id":"d23f6cdf-ca66-4839-b6b7-e54635233acb","resolution":{"observed_at":"2026-08-06T14:06:46.962524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:46.993040Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:46.993040Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:80ac19b6a31fea0d2cf828e594d61530fb419c4d8918082a1e61e5bd5affd376","observation_id":"e1a9daa0-2d9e-4549-8363-ebefb4a1729d","resolution":{"observed_at":"2026-08-06T14:06:46.993040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.075811Z","title":"Model compression","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.075811Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c5f45d793d784e6a0129e1305da338b0ad48a08f975db2d89fa2594fa958b81a","observation_id":"be09bf4a-29de-485b-82f0-4035df11f923","resolution":{"observed_at":"2026-08-06T14:06:47.075811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.143911Z","title":"Proxylessnas: Direct neural architecture search on target task and hardware","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.143911Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f6e3b0b9d0b8f558a40722b3eec10ade8dc6c5596720b1e7ca52ab0fd099c820","observation_id":"793d2b1d-683f-483c-9e7c-9c15c5782389","resolution":{"observed_at":"2026-08-06T14:06:47.143911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.247730Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.247730Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a76f3707ec02fb6a1e55a69374f51a52f5017e975d2d94f6cb069b53cc174068","observation_id":"a1895085-fd07-4ccd-94fe-43f42a7465f5","resolution":{"observed_at":"2026-08-06T14:06:47.247730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.347070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.347070Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:dbd3e4a23f6b7dd1e79362583f13e5a5ed10dc560bd306bee0190b71811f3a77","observation_id":"648918c6-b4d4-4d93-8a5d-c85f7e183672","resolution":{"observed_at":"2026-08-06T14:06:47.347070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02735","last_updated":"2020-07-24T02:15:24Z","snapshot_observed_at":"2026-08-03T20:21:58.372162Z","submitted_at":"2019-06-06T17:55:01Z","title":"Residual Flows for Invertible Generative Modeling","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02735","snapshot_observed_at":"2026-08-06T14:06:47.443142Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.443142Z"},"links":{"cited_paper":"/paper/1906.02735","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f939ae24021a6f0c51a7d5426f404c1f7295dd11caa651b26b73e8c5b7629355","observation_id":"7df8bb55-940e-47a9-b346-2bc0ab49f12d","resolution":{"observed_at":"2026-08-06T14:06:47.443142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.543576Z","title":"On the relationship between self-attention and convolutional layers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.543576Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:ae499e42b7ed00bc0519e4bcde9d46208edcddfc328b831805d493b78a1c588d","observation_id":"9a1682e7-47c9-420c-9f35-1c34f167d119","resolution":{"observed_at":"2026-08-06T14:06:47.543576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.582930Z","title":"Scalable high-resolution pixel-space image synthesis with hourglass diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.582930Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:80a8b3ff3c41c480cf097529d7811434a45710d847cf50ecf59c62e60a8c674f","observation_id":"8c4a8b1f-a3e8-4641-a9aa-ff205bec0056","resolution":{"observed_at":"2026-08-06T14:06:47.582930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.618477Z","title":"Approximation with artificial neural networks.Faculty of Sciences, Etvs Lornd University, Hungary , 24(48):7, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.618477Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7c1b12a74be9c27912eb2235803641b926589548c88dd62cf50b77cc5e31d281","observation_id":"a41f28e4-da3e-4bf5-8475-09ea1fb42f2f","resolution":{"observed_at":"2026-08-06T14:06:47.618477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.636071Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.636071Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:57e035dcb62dfb93efd746a7214418ee9cef8b6094b1bfe78e8e748a9b24122b","observation_id":"e9ee7828-92c1-4ae1-9230-5ec823e32374","resolution":{"observed_at":"2026-08-06T14:06:47.636071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08698","last_updated":"2023-07-17T17:57:56Z","snapshot_observed_at":"2026-08-04T12:09:15.933692Z","submitted_at":"2023-07-17T17:57:56Z","title":"Flow Matching in Latent Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08698","snapshot_observed_at":"2026-08-06T14:06:47.673758Z","title":"Flow matching in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.673758Z"},"links":{"cited_paper":"/paper/2307.08698","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:0f494dcf7938b8eae5e816ae4df93ff0d13bab24f731baedebd8b71e1d9e3c7d","observation_id":"1377b4c8-5e6f-4294-a304-ee8998b1ec70","resolution":{"observed_at":"2026-08-06T14:06:47.673758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.709194Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.709194Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:84859ff12cf91b9e9da10ff13e34d40c731ced45e4d67ddde3aaadc853758de5","observation_id":"4276fdd8-b0ca-48b1-a64d-9df14e2d5321","resolution":{"observed_at":"2026-08-06T14:06:47.709194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.745710Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.745710Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:efa887c601e289c51a0a5ffa30a628c87804d2106ab4a24f612e1bb3fa8051da","observation_id":"93270ccd-e48d-4eb7-b9a8-9b70c4876cf7","resolution":{"observed_at":"2026-08-06T14:06:47.745710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.783734Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.783734Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:03d67415f83b54a2a382451e3c9adb62a4829c6bf68d658ddc16fa5233c29fc2","observation_id":"5474901a-2ac5-495f-9ee7-d739c862d9db","resolution":{"observed_at":"2026-08-06T14:06:47.783734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.822039Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.822039Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a3ffd4cb5e9dc31526b23e9de8b5e9304584e957996d7abf4351640edb49474c","observation_id":"f368c111-dd35-4f9f-89b1-20d09b229c8e","resolution":{"observed_at":"2026-08-06T14:06:47.822039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.868578Z","title":"Ensemble methods in machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.868578Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:64629feb14bd818e45849b8aa924c226b10bb602b75001c3b929eba71615edfe","observation_id":"06d97509-c12a-455d-8b0f-1ce73856a2a9","resolution":{"observed_at":"2026-08-06T14:06:47.868578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:47.915496Z","title":"Density estimation using real nvp, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:47.915496Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a0a4ed86a675b43a60fe3edc6618592eb8a52161dba7708a61b74c5f4d1fba9f","observation_id":"c3b2a7ae-134e-4616-b343-25314c3569d8","resolution":{"observed_at":"2026-08-06T14:06:47.915496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.05168","last_updated":"2020-04-13T00:01:14Z","snapshot_observed_at":"2026-07-06T08:50:34.361183Z","submitted_at":"2020-01-15T08:05:55Z","title":"Invertible Generative Modeling using Linear Rational Splines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.05168","snapshot_observed_at":"2026-08-06T14:06:48.001419Z","title":"Dolatabadi, Sarah Erfani, and Christopher Leckie","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.001419Z"},"links":{"cited_paper":"/paper/2001.05168","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4933a566bad45ad59f9fdc7292f347fa36f2d1781d3f33387b339d84f0c7ca8b","observation_id":"906ab785-7c60-4d47-bb7b-2fa3549beab9","resolution":{"observed_at":"2026-08-06T14:06:48.001419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.066250Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.066250Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:2cee2ae15e835143ae8dae7de4d1e8a4eae2060fc7b333d2681561cd786a65d9","observation_id":"dda88302-748c-4afa-9a39-c7b899fd8ff1","resolution":{"observed_at":"2026-08-06T14:06:48.066250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.125063Z","title":"Augmented Neural ODEs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.125063Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:39702a4c8667c4b2f7d188cd5d7488db5b482de956af0b4c887968599e993a1b","observation_id":"5bfa5ba9-729b-4fad-9612-b6b269492633","resolution":{"observed_at":"2026-08-06T14:06:48.125063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02145","last_updated":"2019-06-05T17:05:53Z","snapshot_observed_at":"2026-07-06T07:58:12.570715Z","submitted_at":"2019-06-05T17:05:53Z","title":"Cubic-Spline Flows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02145","snapshot_observed_at":"2026-08-06T14:06:48.167137Z","title":"Cubic- Spline Flows, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.167137Z"},"links":{"cited_paper":"/paper/1906.02145","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:689b7e74ac75e653e1fac40ad6d9286d3b5d172f69dff8cfc30995092f536aa8","observation_id":"77439084-6c1d-4a41-81c4-f23f778dba6a","resolution":{"observed_at":"2026-08-06T14:06:48.167137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.206848Z","title":"Softmax linear units","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.206848Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:3fdf958936b13e943e37b879f53a17e8378c7bc0c3e592f09b5c5a375b47c493","observation_id":"28b67fa9-d277-431e-9ee7-6d37db9250d9","resolution":{"observed_at":"2026-08-06T14:06:48.206848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.286909Z","title":"Visualizing higher-layer features of a deep network, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.286909Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:974be957cd299dab26b635c76dbbd581eeb22c378c35aa46732f244e3ec5ce29","observation_id":"2aa7e9b5-deb8-464f-a6ec-053bd6ee0813","resolution":{"observed_at":"2026-08-06T14:06:48.286909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.387069Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.387069Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:554d22fa17ef2d82a25b167ef97e77aa388f0695f632eefca3934e2062c8d838","observation_id":"666fe322-2a35-4355-862e-ae439a8a9f86","resolution":{"observed_at":"2026-08-06T14:06:48.387069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.421234Z","title":"Fuhr and Michael Kallay","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.421234Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:78d35a16b3429b3ee9fc3a8add5ba414a32e707963392402b8c33aba131fd0df","observation_id":"ff0831d4-cb96-423a-bfc3-0c6018b91b3c","resolution":{"observed_at":"2026-08-06T14:06:48.421234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.461605Z","title":"A new algorithm for data compression","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.461605Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:45c3f3c0bf8e35f853fda36a6ecf97c6a7a5434f8602bb88e6775de9203728d0","observation_id":"dc64602e-a2de-44c8-a48c-a3a496f7e955","resolution":{"observed_at":"2026-08-06T14:06:48.461605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.502505Z","title":"Swagan: A style-based wavelet-driven generative model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.502505Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:0d5f506f8029c9f48e76dd765333a098b65fe9167319a4d570ba595a70edadb6","observation_id":"58fc5889-3e95-47d1-b36d-44e19b67a47f","resolution":{"observed_at":"2026-08-06T14:06:48.502505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.520479Z","title":"Masked diffusion transformer is a strong image synthesizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.520479Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d748c65729a2b8120fb4d76ac40c1c842d28701efc2d7c9446078eac0adcbf66","observation_id":"78168745-2ac9-467d-9653-c95141ecf360","resolution":{"observed_at":"2026-08-06T14:06:48.520479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.563673Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.563673Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d17f36144239da800c214a22957657b95e44f2ecbafac3822dc3fe1be8136f6f","observation_id":"e756e0c4-60ea-4537-87d2-27cfe4c59a27","resolution":{"observed_at":"2026-08-06T14:06:48.563673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.640707Z","title":"Ganalyze: Toward visual definitions of cognitive image properties","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.640707Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:abf97373e02b22984bfce1a78f7c2525dea719bf629c3711e54cc327e131808a","observation_id":"3c095272-db90-47a7-a99e-ff43dbfc3b74","resolution":{"observed_at":"2026-08-06T14:06:48.640707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.710389Z","title":"Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.710389Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:da5f54b29a8bfaee3461ab7dc66286ebf1463724052b058d304a87ce1906083e","observation_id":"8df19ef3-b00f-491d-8261-3a96665861d2","resolution":{"observed_at":"2026-08-06T14:06:48.710389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.793336Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde- Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.793336Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:2d9fb46b13ed6b694c5ffa8e639dffe0ff0a482dad245eb42f1d88dc922722ca","observation_id":"a23db819-178f-43a7-96eb-e04805a27d0a","resolution":{"observed_at":"2026-08-06T14:06:48.793336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.874583Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.874583Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:65cc2c9e535d7acbd1650af6989680f924edbb75d9ae0ae1b78dd5152a30ded8","observation_id":"e2644c66-f890-4554-a1bf-05d458044f9e","resolution":{"observed_at":"2026-08-06T14:06:48.874583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.919018Z","title":"Neural turing machines, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.919018Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:167ae2ff3e47ae1a5c507a92fe8a0eacfa3702f1264c8b9f3e5bccc021c053b4","observation_id":"34a3f24b-6fc6-44f9-aed6-cc7ca9e3b1e5","resolution":{"observed_at":"2026-08-06T14:06:48.919018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.942612Z","title":"Densely connected normalizing flows, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.942612Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:a8a4351c1646356fde069daaf22eb380522b50430a104d7de5e35021fdb160ea","observation_id":"a7490690-3c38-48cc-b00b-16f999bcdea2","resolution":{"observed_at":"2026-08-06T14:06:48.942612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:48.983204Z","title":"Pattern theory: from representation to inference","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:48.983204Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:bb2910c56896021a0a877c0c52e627c12662aa678bcb2e94247bad16484748f3","observation_id":"fc805aa6-caa6-4b0b-9e3e-67a2a54ddf62","resolution":{"observed_at":"2026-08-06T14:06:48.983204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.024249Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.024249Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:eafcf888cb6e9031c8ff05b3dccb6a6710dca2e52b60f2085b439ce194b7f41a","observation_id":"7b110edc-1df4-404a-9d97-13af0ac58142","resolution":{"observed_at":"2026-08-06T14:06:49.024249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.077179Z","title":"Starflow: Scaling latent normalizing flows for high-resolution image synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.077179Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:2b5874e8312243d9769c99a04375d77698011a3c07c332a1b31b85dd309d870e","observation_id":"e90ddf50-d7c0-4589-8ee7-55fa0168dae3","resolution":{"observed_at":"2026-08-06T14:06:49.077179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.127826Z","title":"Variational Inference with Orthogonal Normalizing Flows","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.127826Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:10326b437bb7373e9513c571b892f98242a2bdfe103993e81c6e5df5006cc652","observation_id":"53203af2-21cc-4ec3-a879-e31a22b3b649","resolution":{"observed_at":"2026-08-06T14:06:49.127826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.165078Z","title":"Neighborhood attention: Dynamic restriction of self-attention, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.165078Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4871645afb57f509f016ca7baf7ca9f194b894e118d8a686d7abce614a47dda0","observation_id":"ae446254-25c6-4a3c-b0bf-6220bf1cca74","resolution":{"observed_at":"2026-08-06T14:06:49.165078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.181356Z","title":"Dilated neighborhood attention transformer, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.181356Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:eeb65ed66d073d8cd3f2804dc54b3b62eb14da8f03e141fc962abc4cdb820ed5","observation_id":"135e01b6-f517-474a-bb6e-b2ffe06b7e23","resolution":{"observed_at":"2026-08-06T14:06:49.181356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.271019Z","title":"Escaping the big data paradigm with compact transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.271019Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:05efe4f805a442be1f7f56c2dd0aacdc837405e14473b0605bcacb71d941f4c7","observation_id":"d17944df-d8ef-4c80-93f6-a45ffaa1f9c7","resolution":{"observed_at":"2026-08-06T14:06:49.271019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.336400Z","title":"Neighborhood attention transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.336400Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:b2d635e8a1f1a423441577ef0604e9e2129502856f5ff23601aad0c68d7cd147","observation_id":"bf6873b2-9d89-42d1-bf6a-711f2ec1323a","resolution":{"observed_at":"2026-08-06T14:06:49.336400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.377421Z","title":"Faster neighborhood attention: Reducing the O(n2) cost of self attention at the threadblock level, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.377421Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:67aafe26b9999c034414116483d65fe551dee0695bf651e8f2ba1a86ab5e5c40","observation_id":"c0511483-1d93-4508-839c-866a1922277c","resolution":{"observed_at":"2026-08-06T14:06:49.377421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.418782Z","title":"Generalized neighborhood attention: Multi-dimensional sparse attention at the speed of light, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.418782Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:866dcc527b74edd5ef02e6478bd6a1d7f702661453be34564ffb497d0955aeaf","observation_id":"a8d0a652-8582-4b5b-a032-8089200028b7","resolution":{"observed_at":"2026-08-06T14:06:49.418782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.444359Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.444359Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:cb4eba069e1c45743883c085d01631763b469a01182e552dfafb589eb1f391ea","observation_id":"556311bd-ba03-47d9-9648-2e3006018c86","resolution":{"observed_at":"2026-08-06T14:06:49.444359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.451014Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.451014Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:95b84c2c698ac4b5771693cb2f126b73c63c563b8011f19ed80b0ed8fcf1360c","observation_id":"0a62a550-7e7d-4e1a-b71f-2d2b87ed7ae2","resolution":{"observed_at":"2026-08-06T14:06:49.451014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.463499Z","title":"Identity mappings in deep residual networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.463499Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:9cce51883c0bee5702d3f2d693ce6c05b229f5c141cfa02ddc8cedb73bd038d1","observation_id":"73f9795b-119f-400a-bc37-8ba359cd43fe","resolution":{"observed_at":"2026-08-06T14:06:49.463499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.523726Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.523726Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:45aa93142c4a5f4f49d712a8d74fa42abdd421736367c84716488dc147ecaf1f","observation_id":"a6e67e72-709f-49b2-be4c-63d62ef604cb","resolution":{"observed_at":"2026-08-06T14:06:49.523726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.585761Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.585761Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4d8e5c69c1de82b9296ba5ba28b35cbdf5b89566aae18761a61592ab7240020a","observation_id":"f594c7c4-00b7-40ad-96b7-da9bd77c1c62","resolution":{"observed_at":"2026-08-06T14:06:49.585761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.703823Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.703823Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:b0f941090c113aff7a4d8b95e242463dd49ebbce2d3985962bca06312b10dff1","observation_id":"559425f9-1543-42bb-97e0-4f238b670c78","resolution":{"observed_at":"2026-08-06T14:06:49.703823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T14:06:49.832130Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.832130Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:050d7c0255489c4a26b4a66a10d554ddc5c1afe2934c8392ec155dd0947e35f3","observation_id":"54af68a6-e965-4e7a-98fa-ea7b2f8d2726","resolution":{"observed_at":"2026-08-06T14:06:49.832130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.896163Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.896163Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:5007866269a52d55213ab9043076ac36608fba5e4e822108899542ad27076666","observation_id":"792e3bff-b308-4942-9dc8-0032bf719ca5","resolution":{"observed_at":"2026-08-06T14:06:49.896163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.969256Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.969256Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4915f7f5e1221c2d31f05f4047fe2740327b63336388de430ec88a01781c07e8","observation_id":"458c721f-6732-4dc3-a7d8-b645aee38e67","resolution":{"observed_at":"2026-08-06T14:06:49.969256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:49.992139Z","title":"The convolution exponential and generalized sylvester flows","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:49.992139Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:ab4f2a05232e0ce972ce825d09b7813aa9d33f54f9917461413388d70d941bff","observation_id":"87162926-f4e5-4d78-8c67-ce0c938c78af","resolution":{"observed_at":"2026-08-06T14:06:49.992139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.032524Z","title":"Simple diffusion: End-to- end diffusion for high resolution images, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.032524Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4bddd5a3e69e12940814b09393211383cbfc28e12d2e8bc4be9f854d5fb86560","observation_id":"1dd434c3-6241-4ef1-ace8-1d2a471e8245","resolution":{"observed_at":"2026-08-06T14:06:50.032524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.083346Z","title":"On the limitations of compute thresholds as a governance strategy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.083346Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:e8ec79eb9ca6bbbcd88b409d3f867a3e6dd13a566670042bc9ed0c0434d45552","observation_id":"6e35e3dc-80fe-4749-a876-553ed8061a45","resolution":{"observed_at":"2026-08-06T14:06:50.083346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.126090Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.126090Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:1de691d855693d2da8b4c190c728da3d3ae91ead25c44018fdf12f5e17c43027","observation_id":"09181edf-e9d4-45bd-9e06-adfec0f098ed","resolution":{"observed_at":"2026-08-06T14:06:50.126090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.175921Z","title":"Local relation networks for image recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.175921Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4b1caf0fde3d6ec627f868639ae9464f72308006ffc9695c0886b25edfe8b7e7","observation_id":"273ad117-c694-4237-8a69-9902371222da","resolution":{"observed_at":"2026-08-06T14:06:50.175921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.244461Z","title":"Squeeze-and-excitation networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.244461Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:6ec23bfe0e7b2d3babc51bede487db74dbb918baf1afcd067d251c2bdd8df262","observation_id":"3bd1a13c-0cde-4b96-b40f-5b201fb2d4f8","resolution":{"observed_at":"2026-08-06T14:06:50.244461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.298063Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.298063Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:2983036099e0cc3f7c0be767b6be8971e4288df132e7708976ed2ad1a82bcf74","observation_id":"e982c090-a566-410b-ad1f-5c19b26715fe","resolution":{"observed_at":"2026-08-06T14:06:50.298063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.386432Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.386432Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7265c2712325139438e09b3f2ed12f73d7596931177df802556587ac70330867","observation_id":"2dd1e4fc-89a7-4dfb-ae81-19dbfabed34e","resolution":{"observed_at":"2026-08-06T14:06:50.386432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.440650Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.440650Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:1d9db0ed08e25cf33498716d340cef7ec3025f34ecb5baefe4ffb5178882935a","observation_id":"b7b46247-25b2-43e1-ba0c-ab7668f749a5","resolution":{"observed_at":"2026-08-06T14:06:50.440650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.502025Z","title":"Estimation of Non-Normalized Statistical Models by Score Matching","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.502025Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8e167c06423096e94b4cce7ffdf90d454f7abcfad53b504e5620138029470bcf","observation_id":"1800086c-2857-4384-b083-9d2aadb9dba0","resolution":{"observed_at":"2026-08-06T14:06:50.502025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-06T14:06:50.559460Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.559460Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:050e827659426335d2c3aa7554ab32a7b9614d2040c60f92d1334ac9efaa0def","observation_id":"cea953da-668c-4175-9c08-c80ab35235d1","resolution":{"observed_at":"2026-08-06T14:06:50.559460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.621766Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.621766Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7b2063ab66cb64da4f1613e30c8732c2d1d83af20c70340d0f7d8655cbff1ec9","observation_id":"44b46676-4c5a-4f68-b646-af0900b4e165","resolution":{"observed_at":"2026-08-06T14:06:50.621766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.677472Z","title":"Semask: Semantically masked transformers for semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.677472Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:6f578e57b76d8d181423b4478eb9d900d853aa20dd49e3f81a4ff9be6c818e28","observation_id":"22c222e9-8c81-42aa-9043-fc9410cc51e5","resolution":{"observed_at":"2026-08-06T14:06:50.677472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.780743Z","title":"Face Perception, chapter 43","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.780743Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:080230cfcb7d82daaa610bbf0f24d0710c6632f6f462fda2f310acc22078dfaa","observation_id":"c56ffce9-3be8-445d-b81a-23745962c277","resolution":{"observed_at":"2026-08-06T14:06:50.780743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.814693Z","title":"Progressive growing of GANs for improved quality, stability, and variation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.814693Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:ec7e24552bf43de5ec505538dfafb2cea82545a3df17b4e2c9c3ff6178d7c2b2","observation_id":"c37d5d5e-056f-4cb1-a791-fb3e7ba5b540","resolution":{"observed_at":"2026-08-06T14:06:50.814693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.860399Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.860399Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c24726422d8e737ecc3ac909bc2e60bdd4e0debfa8117479d7cfa17b5285bff5","observation_id":"e65740ff-2e8f-4305-b6a9-30a1c6497c97","resolution":{"observed_at":"2026-08-06T14:06:50.860399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.926567Z","title":"Training generative adversarial networks with limited data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.926567Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:d0cbe4d134260b43a2f6ed237fe5534a0bd387d7c58e823132127370ce613507","observation_id":"0dcf6e1a-a4ab-4a7d-8b86-fd36f8fe6f90","resolution":{"observed_at":"2026-08-06T14:06:50.926567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:50.959556Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:50.959556Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:566384ada1c194d9caef6c7a7af888682f03fc239604f90078634820bb1c77c4","observation_id":"83060158-189b-44e6-b222-bf5995978336","resolution":{"observed_at":"2026-08-06T14:06:50.959556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.004172Z","title":"Alias-free generative adversarial networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.004172Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:933a7236094853986dadc2e2abd9fa69eba0378d8e8df67e6041a6f0f56a00f9","observation_id":"c0f67931-2fb2-4881-af8a-da6643180201","resolution":{"observed_at":"2026-08-06T14:06:51.004172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.066428Z","title":"Design amortization for bayesian optimal experimental design","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.066428Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:86e8ae891fd993ba74be1dc405fd3bbd827399647e5638c7ec1ab916dae326a3","observation_id":"122be77e-4532-4630-82b1-02c353f624ef","resolution":{"observed_at":"2026-08-06T14:06:51.066428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.097671Z","title":"Soft truncation: A universal training technique of score-based diffusion model for high precision score estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.097671Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:7ee8f163fb747d9d856c3e0554f5946a2734a35c26c19127738d14ffab36f3d7","observation_id":"3fac4448-86bd-478d-882a-93e00163f06c","resolution":{"observed_at":"2026-08-06T14:06:51.097671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.102905Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.102905Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:51aa290a2c933d9b48aea350a543b6f9be444fafc86335d9f67e68d93d3de045","observation_id":"b401ba84-2259-47dc-b396-97465d0cca7e","resolution":{"observed_at":"2026-08-06T14:06:51.102905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.106085Z","title":"Glow: Generative Flow with Invertible 1x1 Convolutions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.106085Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c0297cb7e431a6963fe0e42bb81771f53c5c682eb92c3725de75d3ae5873842f","observation_id":"b6081e1d-b067-4a68-9003-329d2709e154","resolution":{"observed_at":"2026-08-06T14:06:51.106085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.109144Z","title":"Kingma and Ruiqi Gao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.109144Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:8e0801a88e8f109cecc4569fd286286639b9f71702a306942b9f55e85ac07e64","observation_id":"92d882ff-aa7b-408e-8c1f-0cb7d317e749","resolution":{"observed_at":"2026-08-06T14:06:51.109144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.111982Z","title":"Kingma, Tim Salimans, Rafal Jozefowicz, Xi Chen, Ilya Sutskever, and Max Welling","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.111982Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:3acc549a1f775500a87405523365878d7c470ee7c8050c7dd049d407679de697","observation_id":"a864a28b-96db-4f86-a974-3e4c2c39a478","resolution":{"observed_at":"2026-08-06T14:06:51.111982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.114889Z","title":"Big transfer (bit): General visual representation learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.114889Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:545d1109037f7289bf53058d3414cbdafc6fe9bf2e3b0a3e9f0ab74b745bcbae","observation_id":"3f450f9e-2b3b-426e-bd59-0ace67173e3b","resolution":{"observed_at":"2026-08-06T14:06:51.114889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.118255Z","title":"Revealing the dark secrets of BERT","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.118255Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:561226c2fc6998fbfda1bef90b82e68fca4014f5e7f9d8dc2b10cac681d6b04b","observation_id":"aa150093-0620-4e85-b3ca-94a6fb1cb592","resolution":{"observed_at":"2026-08-06T14:06:51.118255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.121028Z","title":"Learning multiple layers of features from tiny images.(2009), 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.121028Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:36ef0f12bb7b75374a0f461fb83354149b06f8a851cad4a39bbfb802d9c8cf0d","observation_id":"8ba03784-9fe4-42c3-9fd4-41d6be1157c3","resolution":{"observed_at":"2026-08-06T14:06:51.121028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.123812Z","title":"The role of imagenet classes in fr´ echet inception distance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.123812Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:beeeb9d9c13291350cc9b7c93ddd3bad41efc5942a0ad071ccc16ece0c12afda","observation_id":"34e16a40-0add-4478-9959-b87d89b64cde","resolution":{"observed_at":"2026-08-06T14:06:51.123812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.126557Z","title":"Howard, Wayne Hubbard, and Lawrence Jackel","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.126557Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f3b6353090d64a170003708da5b3e424bc9306759ec939c1ae2c9bf6432f744f","observation_id":"6f23a532-41c4-4324-bd4d-6d2df39ca268","resolution":{"observed_at":"2026-08-06T14:06:51.126557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.129391Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.129391Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:c55d76c174aacfb92f9d5d6a7464886ecddc28180803e92bd53ff11c6472028b","observation_id":"6ca5c8df-7dd9-4c9d-b261-e5c3942fb104","resolution":{"observed_at":"2026-08-06T14:06:51.129391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.132239Z","title":"Smooth manifolds","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.132239Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:4560c8cd2164b1b4aea5f95f3882c1b919ebc705d815f89c7dc64b9990129eb3","observation_id":"c8c0bdf2-bb63-4361-9926-1fa0f2ac10a5","resolution":{"observed_at":"2026-08-06T14:06:51.132239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.135213Z","title":"ViTGAN: Training GANs with vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.135213Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:f32f4158c25e66f73454c322e5b9210d4d2a391ce891590810428f3932854b0d","observation_id":"2a069103-5c3a-4e9f-bdf8-bfd39c349184","resolution":{"observed_at":"2026-08-06T14:06:51.135213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.138356Z","title":"SNIP: SINGLE- SHOT NETWORK PRUNING BASED ON CONNECTION SENSITIVITY","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.138356Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:514ecbf0349d35e5f02d67801ec42f6f8023624997988ec0de195879492d9da1","observation_id":"aaa8493b-b635-4b0f-b43d-caadf969ea35","resolution":{"observed_at":"2026-08-06T14:06:51.138356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.141442Z","title":"xformers: A modular and hackable transformer modelling library","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.141442Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:3bb97afe8d50bb74146d30e48e7f93ba6d488498c34bbeb2309bb328a5e8bb9d","observation_id":"4e625c77-2414-4e96-ab2f-ad8caa186401","resolution":{"observed_at":"2026-08-06T14:06:51.141442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.144428Z","title":"Demographic bias effects on face image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.144428Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:590e2b61eebaf4b867e8837b30afdcc346761c8b0461f13d59e47c393bef1a95","observation_id":"c4678edd-262e-4ec6-9a39-723df4516573","resolution":{"observed_at":"2026-08-06T14:06:51.144428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:51.147174Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:51.147174Z"},"links":{"citing_paper":"/paper/2507.19795"},"observation_digest":"sha256:5495654a439a3fd2d7bee9801fc6370189e4da295d5148c9533db270bb008fa3","observation_id":"08ae80c0-aedf-4df6-a828-0233bd8edae4","resolution":{"observed_at":"2026-08-06T14:06:51.147174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.19795","last_updated":"2025-07-26T04:56:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T01:34:16.703326Z","submitted_at":"2025-07-26T04:56:53Z","title":"Smaller, Faster, Cheaper: Architectural Designs for Efficient Machine Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":182},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 182 outbound references and 0 inbound Pith citation observations for arXiv:2507.19795."}