{"as_of":"2026-08-10T11:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72c8e59f36c5d505c8ff9da061bbb0c336990f519ebaaa616c0eeff409b5055a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:14:18.740009Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03537/citation-record","integrity":"/paper/2608.03537/integrity","json":"/paper/2608.03537/citation-record.json","paper":"/paper/2608.03537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.266172Z","title":"TensorFlow: A system for Large-Scale machine learning,","venue":null,"work_id":"d1408944-48c3-403b-92de-65c67ed79ca4","year":2016},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.150954Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:3f62bfca21525c166714a3f208c54146d19d0f20c53e3706d54ed21177189e60","observation_id":"de83941b-3105-4d33-8c4f-3e8f4b789b38","resolution":{"observed_at":"2026-08-05T17:14:20.269781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.256402Z","title":"Learning to op- timize halide with tree search and random programs,","venue":null,"work_id":"57935cca-9a56-4e60-961b-be95a49de47b","year":2019},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.176970Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:26b238b15b51d448fef28f95ac49d2cf0bfcaa92eb5500aa7f6cc85b112a60dd","observation_id":"f8a1a920-6bfd-4beb-acb7-5ba9610ede9a","resolution":{"observed_at":"2026-08-05T17:14:20.260061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:15.249607Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.249607Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:c0c04e838d7fe89babb17d5077e4e86a0cb7e3ad6583ac37b044826c4e63735a","observation_id":"dbbd22f3-545c-4526-8c50-63f458e096f7","resolution":{"observed_at":"2026-08-05T17:14:15.249607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.241980Z","title":"TVM: An automated end-to-end optimizing compiler for deep learning,","venue":null,"work_id":"70e1b1c2-d76f-4ccc-9562-a494ce85030a","year":2018},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.316409Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:5f822e66b753bda7b463d3e78a124335e5de9a89b1cd050d185204ff52b5381a","observation_id":"8a731703-094b-4bfc-b007-dbb1f94e2176","resolution":{"observed_at":"2026-08-05T17:14:20.245075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.232280Z","title":"Learning to optimize tensor programs,","venue":null,"work_id":"0475bab7-0af6-4923-ab71-e444f93d590f","year":2018},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.395958Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:ebc5dd858cb999934b2f72486528d96447e0385074afa81b181b5f86b4fc0546","observation_id":"58231797-7d19-4de7-a11b-dcebafd6cc81","resolution":{"observed_at":"2026-08-05T17:14:20.235551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.223494Z","title":"Evt: Accelerating deep learning training with epilogue visitor tree,","venue":null,"work_id":"66e14369-2b94-41e0-8a52-18305da30bf6","year":2024},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.470126Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:b4b9dd9a803687fc63aafe7fb15e6613d4d0fe74388d48d13b1f5cb42841067b","observation_id":"d1a62d32-53c3-4fb2-b398-29dad4f513d3","resolution":{"observed_at":"2026-08-05T17:14:20.226744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.0759","last_updated":"2014-12-18T01:13:16Z","snapshot_observed_at":"2026-07-06T03:56:19.212671Z","submitted_at":"2014-10-03T06:16:43Z","title":"cuDNN: Efficient Primitives for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.0759","snapshot_observed_at":"2026-08-05T17:14:15.535544Z","title":"cuDNN: Efficient primitives for deep learning,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.535544Z"},"links":{"cited_paper":"/paper/1410.0759","citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:6a757d2ba0c9925c2dfd1b94d03830f27439b714355e48b7f9cb89f8b6ed33bd","observation_id":"95ca7f43-86fd-4cc4-ac48-9c0896e07727","resolution":{"observed_at":"2026-08-05T17:14:15.535544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.213879Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":"2f0f94cb-f3b2-4efd-ac96-59d85b889dc0","year":2024},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.581087Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:0f730eb6b31f045c68645f6faba7978841d8cbf2ef7f089e369cb80e20f54515","observation_id":"51f1f166-1332-4459-969e-2676d49c715e","resolution":{"observed_at":"2026-08-05T17:14:20.217549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.203859Z","title":"Analyzing the impact of kernel fusion on gpu tensor operation performance: A systematic performance study,","venue":null,"work_id":"62d3fd08-5765-4f4f-b6d6-6a6c8431085e","year":2026},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.658022Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:ac55b966ff5f3ad16ebd8c885e97a15e4031b57ee7a5f92909e66246185bb28a","observation_id":"6af0f6c4-efec-4282-818d-dde8d198105e","resolution":{"observed_at":"2026-08-05T17:14:20.207763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19269","last_updated":"2026-05-20T17:38:24Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T02:30:43Z","title":"CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19269","snapshot_observed_at":"2026-08-05T17:14:15.729983Z","title":"Coda: Rewriting transformer blocks as gemm-epilogue programs,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.729983Z"},"links":{"cited_paper":"/paper/2605.19269","citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:a131d7962d0510b41a1540fb66268805a90f6fdce9084bbabae82edeb8c59da0","observation_id":"1ebde18d-88a7-4062-ad49-e34abe702834","resolution":{"observed_at":"2026-08-05T17:14:15.729983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.194082Z","title":"Mixed-input matrix multiplication performance optimiza- tions,","venue":null,"work_id":"d1f41d03-707f-4b4d-bb9b-c2507b511897","year":2024},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.790178Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:b23a1112d8a3851728e60f8bf0b7c362f39e0048d62b118752f5a2b0285c9a16","observation_id":"6078042a-77b1-4e35-841c-37f57c13b633","resolution":{"observed_at":"2026-08-05T17:14:20.197930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.184545Z","title":"Fireiron: A data-movement-aware scheduling language for gpus,","venue":null,"work_id":"65edd1f4-3488-4322-89d5-ab01b6e3e0e7","year":2020},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.843159Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:f7a12cdbf59077adbd844372ac7d48932940ad520a4ef02d5288595a566c1ad2","observation_id":"7fa5ce43-b93d-4440-af7d-cc99e82c7e42","resolution":{"observed_at":"2026-08-05T17:14:20.188148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.175550Z","title":"Making deep learning go brrrr from first principles,","venue":null,"work_id":"d7564f2b-564b-461a-bdeb-937ac35f1c7e","year":2022},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.881797Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:527dbf3bdba846d61f4fc502834321a3b8fc1bbc9074f0a60d4c3e74f14ca367","observation_id":"fb018d17-0471-4be0-9f06-6950717cd1fc","resolution":{"observed_at":"2026-08-05T17:14:20.178532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.166501Z","title":"Data movement is all you need: A case study on optimizing transformers,","venue":null,"work_id":"d5f6fab0-6d6a-4592-aa21-ffc454102e7d","year":2021},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:15.944166Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:60a1dcb22d227c03196b43d98382614236d4d0eea514c8a635b6d733c66d2dce","observation_id":"9d5a46cd-8399-4fc1-8dd7-111352935560","resolution":{"observed_at":"2026-08-05T17:14:20.169517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:16.004122Z","title":"In-datacenter performance analysis of a tensor processing unit,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.004122Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:1400197df6e37085d446baa3f11b546b88bd6ed8fd0348e3eef63df3f52d257e","observation_id":"6697361a-1a6d-40cb-9f81-84b8fbb683c8","resolution":{"observed_at":"2026-08-05T17:14:16.004122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:16.083133Z","title":"onednn graph compiler: A hybrid approach for high-performance deep learning compilation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.083133Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:a235f492db6fd332eb1dec22964b3665fb5c8bc73c2d42525fb83dd4380e22e2","observation_id":"05a01e35-2706-42a8-b9ab-8ee24c562ece","resolution":{"observed_at":"2026-08-05T17:14:16.083133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00091","last_updated":"2019-05-31T21:51:16Z","snapshot_observed_at":"2026-08-02T13:53:54.252223Z","submitted_at":"2019-05-31T21:51:16Z","title":"Deep Learning Recommendation Model for Personalization and Recommendation Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00091","snapshot_observed_at":"2026-08-05T17:14:16.231025Z","title":"Deep learning recommendation model for personalization and recommenda- tion systems,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.231025Z"},"links":{"cited_paper":"/paper/1906.00091","citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:6617a700970e71dd77115117e433e7cbab98f0c6245ebcb289b531d5fa80afc8","observation_id":"23b93095-fb03-43d5-aac3-1699d63f0319","resolution":{"observed_at":"2026-08-05T17:14:16.231025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.145507Z","title":"Dnnfusion: accelerating deep neural networks execution with advanced operator fusion,","venue":null,"work_id":"9cf38511-a519-4fa6-adc7-28d558a424ab","year":2021},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.305681Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:baa59c94f3d054199298733afb8fc532bd58bce7fccc171720eeb3aa905f45a0","observation_id":"f1e3e51c-3f46-4c85-86e8-8cbfa62bab2d","resolution":{"observed_at":"2026-08-05T17:14:20.149447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.135823Z","title":"Cutlass: Fast linear algebra in cuda c++,","venue":null,"work_id":"407884ec-1f26-4570-9ec2-7c0def7359a0","year":2017},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.385907Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:5646e0b230e3b46af7f5bfa0f706e0c99b101eed323709bc9d5b9144c266de4b","observation_id":"f1901e4c-4a20-4c97-b9b9-409eb397507a","resolution":{"observed_at":"2026-08-05T17:14:20.139488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.126277Z","title":"NVIDIA TensorRT: An sdk for high-performance deep learn- ing inference,","venue":null,"work_id":"e3f049ad-e475-4a04-9689-d9c98d6b6009","year":2017},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.440457Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:215e44c13009fe01fdac5e1029be5b715cb0662b364766893320e06cf64c5e55","observation_id":"ca35fd91-cbdb-48fb-a424-ec2e0d94829d","resolution":{"observed_at":"2026-08-05T17:14:20.129913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.115876Z","title":"cuBLAS: The nvidia cuda basic linear algebra subroutines library,","venue":null,"work_id":"827fc502-ae1b-4270-b89f-acec50c81bec","year":2026},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.547526Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:b6149eeb0b487605c0adc920fa7182c1f8a576274692835a6eb0997313569ac0","observation_id":"89097831-03eb-41e5-b98f-24a82aea9918","resolution":{"observed_at":"2026-08-05T17:14:20.120105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.105521Z","title":"Cuda c++ programming guide,","venue":null,"work_id":"b5c3ff9c-8b4d-422c-a5b0-57557908f5f5","year":2026},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.641554Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:af9a945d491babf900c9ade4240749ab6803315940effbbb5f1672843babfab5","observation_id":"5a209196-fa8c-452d-b4d0-d75d7bf85ba5","resolution":{"observed_at":"2026-08-05T17:14:20.109012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.095665Z","title":"Triton: An open-source programming language for writing highly efficient gpu code,","venue":null,"work_id":"04c11a4a-2f30-45e0-9c5c-e0df4bfec9f1","year":2019},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.692826Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:4c8e40798ab425c380639fbdf1e4ae3eaa086af6823a2fa46df1c13447746bcd","observation_id":"686478c4-0146-4fbc-b377-e36874ff1810","resolution":{"observed_at":"2026-08-05T17:14:20.098694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.086055Z","title":"Automatic kernel fusion for image processing dsls,","venue":null,"work_id":"bb93f450-7629-428f-a3ed-cd221619cc93","year":2018},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.771487Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:dfcf0eda10a392b4a41350ca1d07fd364042dde37552c9dc5be62145dc7470ac","observation_id":"0a9ee1b1-8a15-42b4-8ec1-b9bbe5dc9b10","resolution":{"observed_at":"2026-08-05T17:14:20.089869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.074834Z","title":"Tensor program optimization with probabilistic programs,","venue":null,"work_id":"43703449-850d-41f0-b75e-b7df6f99c805","year":2022},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.872430Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:48298da5946c46835432046477cc48672472ef1c24eb26969d4ba6923c951db8","observation_id":"312e487d-0668-4644-8a4f-af5fe7ce1592","resolution":{"observed_at":"2026-08-05T17:14:20.079505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.065191Z","title":"Astra: Exploiting predictability to optimize deep learning,","venue":null,"work_id":"e78f2f07-ef77-4a05-bb37-e90d02ba9b79","year":2019},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:16.938136Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:dd44dd70fefa3037ef9bf86b6b8f9392e28be2566912238a8c2a688b71d0fdeb","observation_id":"ffe88e2c-271f-4114-aea2-50edce9eb9ac","resolution":{"observed_at":"2026-08-05T17:14:20.068888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.055935Z","title":"XLA: Optimizing compiler for machine learning,","venue":null,"work_id":"d3ad2ace-d7ea-46d8-bcf4-e8bdc2a980cd","year":2017},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.003096Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:09d554234a23e64d8ac44658a16f528bdbe916cc662d5d683b4f7c1e1a73dee8","observation_id":"863ded5a-d359-412e-9574-d3d5d3b30703","resolution":{"observed_at":"2026-08-05T17:14:20.059093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04730","last_updated":"2018-06-29T00:16:36Z","snapshot_observed_at":"2026-08-07T06:36:37.208888Z","submitted_at":"2018-02-13T16:53:01Z","title":"Tensor Comprehensions: Framework-Agnostic High-Performance Machine Learning Abstractions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04730","snapshot_observed_at":"2026-08-05T17:14:17.006441Z","title":"Tensor comprehen- sions: Framework-agnostic high-performance machine learning abstrac- tions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.006441Z"},"links":{"cited_paper":"/paper/1802.04730","citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:f2eb84e08d37b0bac478b4aed1addecca45fefdb9d149282e4e694fa06fa86ac","observation_id":"4fa07624-d39a-45ce-9125-a17a8d8aeea1","resolution":{"observed_at":"2026-08-05T17:14:17.006441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:17.033024Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.033024Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:8d3e3564fb3061f40f718a9d5a3afa347bdbf67686c2eb7bbab2abad27bb1ad0","observation_id":"a844f1b8-d2d4-49c5-95a5-de50376987a9","resolution":{"observed_at":"2026-08-05T17:14:17.033024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08413","last_updated":"2024-06-12T16:57:58Z","snapshot_observed_at":"2026-08-06T19:09:39.550072Z","submitted_at":"2024-06-12T16:57:58Z","title":"Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08413","snapshot_observed_at":"2026-08-05T17:14:17.119250Z","title":"Memory is all you need: An overview of compute-in-memory architectures for acceler- ating large language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.119250Z"},"links":{"cited_paper":"/paper/2406.08413","citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:77dcf6a53f1992cf456b8984c86d695f8374d1e377a6fee3f834e388ece646aa","observation_id":"f6f83c22-51b8-4517-8890-71eb6f4cf4a1","resolution":{"observed_at":"2026-08-05T17:14:17.119250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.039411Z","title":"Mirage: A{Multi-Level}superoptimizer for tensor programs,","venue":null,"work_id":"6c686f52-45c4-46bf-adbd-f4f31c0a1143","year":2025},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.204354Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:630d98f5587a82df51314319af8250edb29d7f8c5ee2fcf21315f3ad70a746c9","observation_id":"cdffdb4f-b987-41bd-ac8e-7b6ce2e49f4d","resolution":{"observed_at":"2026-08-05T17:14:20.042563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.030536Z","title":"{PluS}: Highly efficient and expandable{ML}compiler with pluggable graph schedules,","venue":null,"work_id":"f64eaf95-556b-43d6-b856-c92da9d24cd8","year":2025},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.291030Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:aaf16f48190eb9c5da01148367b00026231cf92c3df1f3d68857638359d24b2e","observation_id":"36b85fd2-7fc5-45ab-b66d-1afe3a4597ef","resolution":{"observed_at":"2026-08-05T17:14:20.033790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.021196Z","title":"Bolt: Bridg- ing the gap between auto-tuners and hardware-native performance,","venue":null,"work_id":"809ed0de-71d1-4ec3-84de-5d8c181c7a95","year":2022},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.409790Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:39a45718ed214604cc345aaaae8463dbf6cdc061c9341716d799bfdbb6f82776","observation_id":"928d8a25-e863-44a8-90f3-64c05f261e48","resolution":{"observed_at":"2026-08-05T17:14:20.024271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.012543Z","title":"Demystifying tensor cores to optimize half-precision matrix multiply,","venue":null,"work_id":"dd33c06c-19ab-4985-8d91-9c090fe40e6c","year":2020},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.590768Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:ea1ea88293fcc23c9f3d961b9caff132479733e22061825168c72f57b3f031c3","observation_id":"5f0a2b04-2e16-4526-9ce1-76b6c58dd2a8","resolution":{"observed_at":"2026-08-05T17:14:20.015551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02043","last_updated":"2026-05-20T23:03:49Z","snapshot_observed_at":"2026-07-06T22:34:48.431368Z","submitted_at":"2025-11-03T20:25:19Z","title":"Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants","version":4},"cited_work":{"arxiv_id":"2511.02043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02043","snapshot_observed_at":"2026-08-05T17:14:19.073912Z","title":"Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants","venue":"cs.LG","work_id":"a29f5a56-8d08-4db5-837a-06389beec8dd","year":2025},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.683649Z"},"links":{"cited_paper":"/paper/2511.02043","citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:fa1dae8a4dce634b47583c27ff3b7c53d82818beae98c43a0e38c3b1029153ee","observation_id":"2129f888-f11e-474b-b1e0-4ac00c7a7479","resolution":{"observed_at":"2026-08-05T17:14:19.222523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:20.003731Z","title":"Mcfuser: High- performance and rapid fusion of memory-bound compute-intensive operators,","venue":null,"work_id":"f9caef09-6f81-4a42-b8cc-45c8aadd0f28","year":2024},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.813122Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:6f7284ec1d91591eca6458cc6e71be0f7f7cc6ea96fb8812c5c1b4f901f4280b","observation_id":"eac4fa19-6532-4ecc-9fc5-12b560288995","resolution":{"observed_at":"2026-08-05T17:14:20.006601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:19.994914Z","title":"Apollo: Automatic partition-based operator fusion through layer by layer optimization,","venue":null,"work_id":"562c4201-9c7d-4db8-9730-6aec2bc6d94c","year":2022},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:17.906380Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:9f27dc3a157ba2f85b59f81dcdc2fd706e9e6513889eab49ae704c9f7cd632f8","observation_id":"7286c7c0-384d-4940-984f-f803229c4991","resolution":{"observed_at":"2026-08-05T17:14:19.997973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:19.985522Z","title":"Operator fusion scheduling optimization for tvm deep learning compilers,","venue":null,"work_id":"43bfb867-c1f6-4b04-897b-7fd94ca0b618","year":2023},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:18.030327Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:cb04e8df91f115a52357fdc02c0a5e4c55b54a1529b61414ad135a0acd9e35ff","observation_id":"8988c86d-05de-410c-92a2-c50d5273d328","resolution":{"observed_at":"2026-08-05T17:14:19.988750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:19.976674Z","title":"Ansor: Generating{High-Performance}tensor programs for deep learning,","venue":null,"work_id":"a70606cf-1258-4d6f-8ddb-1d6572f59301","year":2020},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:18.157773Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:28067214179f329c562ec43e8cbd19c833ec9184347d6a3a173ea1bd8ff71f8a","observation_id":"c3151d97-b989-4776-adf9-6845a8625ce6","resolution":{"observed_at":"2026-08-05T17:14:19.979920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:19.870555Z","title":"Chimera: An analytical optimizing framework for effective 12 compute-intensive operators fusion,","venue":null,"work_id":"7df80203-89ba-47a2-8898-e112a9fa5c13","year":2023},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:18.299365Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:2408bb5bcc277af8f45a1b7c34eaf6af6dbe78b1613ded90cd68b4a04d5cab67","observation_id":"df1ebaf6-9996-4733-8e75-88d7bbf85b24","resolution":{"observed_at":"2026-08-05T17:14:19.970526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:19.667657Z","title":"Astitch: enabling a new multi-dimensional optimization space for memory-intensive ml training and inference on modern simt architectures,","venue":null,"work_id":"551607ed-2ca0-4d9a-8a94-389ddfa37680","year":2022},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:18.390911Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:dc5a18a589e47853d213959d4311b8aef15f84c8b1968f9965f4c0d21347cfce","observation_id":"1fd8d8ba-539e-47e2-8964-c73a52e0752b","resolution":{"observed_at":"2026-08-05T17:14:19.768992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10924","last_updated":"2021-12-17T07:05:38Z","snapshot_observed_at":"2026-08-03T20:33:06.414779Z","submitted_at":"2020-09-23T04:00:53Z","title":"FusionStitching: Boosting Memory Intensive Computations for Deep Learning Workloads","version":2},"cited_work":{"arxiv_id":"2009.10924","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.10924","snapshot_observed_at":"2026-08-05T17:14:18.876654Z","title":"FusionStitching: Boosting Memory Intensive Computations for Deep Learning Workloads","venue":"cs.DC","work_id":"0409305d-2ee2-456b-80e7-de4f99187def","year":2020},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:18.523453Z"},"links":{"cited_paper":"/paper/2009.10924","citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:3b30ce68644816775ccc1faf51e1a82ed9bf447157487827d3317ef1c352d0e4","observation_id":"6c2a8ee3-907b-4f38-bae2-b48a41f44e22","resolution":{"observed_at":"2026-08-05T17:14:18.939842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:19.413717Z","title":"Deep interest network for click-through rate prediction,","venue":null,"work_id":"b60802e2-49a7-46f5-b850-71db4748e832","year":2018},"citing_paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:18.740009Z"},"links":{"citing_paper":"/paper/2608.03537"},"observation_digest":"sha256:10623723fde03b0727d89cab504399a21bd401873c02d096319214fc4b515bef","observation_id":"64845e81-c353-4684-8de4-7f7da5983a75","resolution":{"observed_at":"2026-08-05T17:14:19.549972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03537","last_updated":"2026-08-04T12:15:28Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-08T13:01:29.834444Z","submitted_at":"2026-08-04T12:15:28Z","title":"ComFuse: Fusing Complex Memory-Intensive Subgraphs with Compute-Intensive Kernels For Modern GPU Architectures"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2608.03537."}