{"as_of":"2026-08-11T09:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db3decb65c1eab7935555ff13aaa4d1e9b8f5a611efd5b7ce88b149ceb331d88","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:02:34.906180Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06663/citation-record","integrity":"/paper/2501.06663/integrity","json":"/paper/2501.06663/citation-record.json","paper":"/paper/2501.06663"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.895808Z","title":"When machine learning meets privacy: A survey and outlook,","venue":null,"work_id":"e1f2b0cd-4673-4cab-89ea-ef0b8c769a01","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.621196Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:ec9919d805ee549ef42e70fa6ba3c8f770906c37726b1dd29f9bf64b2d3a2ef6","observation_id":"a528b484-22b8-41de-99d1-1cf3a3a99f5f","resolution":{"observed_at":"2026-08-10T21:02:35.900765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.879447Z","title":"Sok: Security and privacy in machine learning,","venue":null,"work_id":"76570314-0a46-42d1-90f5-6ae2dfba1b41","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.626111Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7947b528b6fc61200e4302e2ce96cc32905e0bfa81df56a879cbc086d180db73","observation_id":"9af989ce-bcda-4c66-86e7-990abe64973a","resolution":{"observed_at":"2026-08-10T21:02:35.884571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.862865Z","title":"DeepReach: a deep learning approach to high-dimensional reachability,","venue":null,"work_id":"4b9be99e-56bf-4930-9bd6-269be77852fb","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.632210Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7df057e869c175ea6373e156bc17df0cfcfdbf524be3a0a7e2d957dc0dd27379","observation_id":"88acd6aa-ff43-4df6-b3f2-c448727d7d2b","resolution":{"observed_at":"2026-08-10T21:02:35.867906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.847575Z","title":"A neural network approach applied to multi-agent optimal control,","venue":null,"work_id":"a2ef5981-d8db-4aa3-9b74-fad794a4a028","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.637703Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:df9bf4730061e57ea716fe20d2a5851839a1db03de0c9f10d8b9002488b15787","observation_id":"c8afabc7-26b1-419a-a5ec-690cedf1334b","resolution":{"observed_at":"2026-08-10T21:02:35.852092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.831776Z","title":"Learning certified control using contraction metric,","venue":null,"work_id":"5e6865d2-2701-4aee-a829-5199d9a04f28","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.642709Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:f91ebe90014d28ac3ad25f1e4605fe2db6d46478f5b2999009277c2a5aa3c9e1","observation_id":"b745b666-7b76-4d58-a007-ecfe8cdfb8d5","resolution":{"observed_at":"2026-08-10T21:02:35.837069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.814522Z","title":"Learning in the wild: When, how, and what to learn for on-device dataset adaptation,","venue":null,"work_id":"80b90fdf-56f6-432e-bf83-f1dc2ff6dd46","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.648811Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:4048cfbf89677a154b48053afbab13f710c7078367d2d28d9f8bde9071b11870","observation_id":"3c3ef8e6-32d0-447f-a720-48282023e1fb","resolution":{"observed_at":"2026-08-10T21:02:35.820269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.795964Z","title":"EF-train: Enable efficient on-device CNN training on FPGA through data reshaping for online adaptation or personalization,","venue":null,"work_id":"ea9b243e-e069-4bf2-a330-6b46d9731e7c","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.655158Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e0eecfdfcfce6032e0b42ac4af295c603d4aabe091b9ed4c70748d1e8140b316","observation_id":"1b9b1210-99c6-4a40-8720-67f6e87e5d94","resolution":{"observed_at":"2026-08-10T21:02:35.800945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.779466Z","title":"BOOST: block minifloat-based on-device CNN training accelerator with transfer learning,","venue":null,"work_id":"7ad4d6f4-6c23-47ff-82a4-c23edfc42644","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.660004Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:738957f94ed1c9e0fc50ef1830897b5b24d7144d6cc139528dbd390a093be1b4","observation_id":"c9790ef0-9554-4736-9790-3be9fa7cb909","resolution":{"observed_at":"2026-08-10T21:02:35.784812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.763108Z","title":"ETA: an efficient training accelerator for DNNs based on hardware-algorithm co-optimization,","venue":null,"work_id":"70770e59-b88e-4d7a-b3c8-d81eeb67af87","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.665402Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:b7d73df5d83b0dfed32c4b266d478bcac49adbd2298e2d2b742ef115b114355c","observation_id":"222ec652-2c4b-438a-af1a-6de3c6671924","resolution":{"observed_at":"2026-08-10T21:02:35.768424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.746063Z","title":"Training deep neural networks in low-precision with high accuracy using FPGAs,","venue":null,"work_id":"9adaad0a-258e-4657-ac82-ba590d20c3db","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.670140Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:934a898f924052cec4c5db6cca34816ad1f55be4f4ddd02f402788a9b6320cce","observation_id":"560807a6-ef4c-4e23-906f-82521fb2e969","resolution":{"observed_at":"2026-08-10T21:02:35.751757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.727558Z","title":"FAST: DNN training under variable precision block floating point with stochastic rounding,","venue":null,"work_id":"438c1e8c-83a5-447a-95b5-2606af180194","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.675239Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:515d951c68979027d0da8df4683f219fbdf87a83610f0d89f4886dc329f43cd2","observation_id":"1c86f4fb-efb4-441e-ba67-0f320166a3c4","resolution":{"observed_at":"2026-08-10T21:02:35.733370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.680780Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.680780Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:102d8868fb35331b4fa5ffa5c6cb055388d2ea79a3d10bc96a56499bd73926f6","observation_id":"f26ca76e-8598-4be8-ae52-2ef688a9c662","resolution":{"observed_at":"2026-08-10T21:02:34.680780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.700384Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"df29997d-48b7-4d28-8523-99b2bd268c8b","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.685425Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:309cff2a10207a22f54626909354771347555d2ca2cfe02cdfbccdaa637ff3b5","observation_id":"1aad8ddd-8844-4a66-9b52-e00249f87d52","resolution":{"observed_at":"2026-08-10T21:02:35.705501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:02:34.689435Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.689435Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:ac9c7471366f398e95cacc14d4b4c66e0359108e300da93fb7bd5cb715f426c9","observation_id":"29feb44a-97a5-4208-83e0-b98acbb960f2","resolution":{"observed_at":"2026-08-10T21:02:34.689435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.684530Z","title":"Segment anything,","venue":null,"work_id":"fea00a86-6383-4ddf-b224-f702631ef62a","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.694119Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:f46b3fba9ac3b16806f593421a541599af32a6fa05b90ccfa45e39b6e3f0b914","observation_id":"433a0d07-9a39-4714-a2fb-66c1eaa8693d","resolution":{"observed_at":"2026-08-10T21:02:35.689465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.668134Z","title":"PINNsFormer: A transformer- based framework for physics-informed neural networks,","venue":null,"work_id":"42477422-5b83-483b-b68f-811e768e97d3","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.698271Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:90d72f5a674efa47bf634ba6dce0c34bc1078997a2281f8039d20204566254a1","observation_id":"9eaed75d-ecba-40f5-834b-8c01c918fbe5","resolution":{"observed_at":"2026-08-10T21:02:35.673202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.650069Z","title":"Federated learning in asr: Not as easy as you think,","venue":null,"work_id":"43278a59-48cd-415a-a5bb-dd3823833e24","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.702459Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:25952a7e15aee0d214c289762c1d9d3c11dcd2dba7e8608c052789773518fc70","observation_id":"ae96de93-2f5c-4ad9-a2de-f2b488434dc5","resolution":{"observed_at":"2026-08-10T21:02:35.655480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15966","last_updated":"2022-04-05T17:57:30Z","snapshot_observed_at":"2026-08-07T12:22:20.618782Z","submitted_at":"2022-03-30T00:50:16Z","title":"Federated Domain Adaptation for ASR with Full Self-Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15966","snapshot_observed_at":"2026-08-10T21:02:34.706338Z","title":"Federated domain adaptation for asr with full self-supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.706338Z"},"links":{"cited_paper":"/paper/2203.15966","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:02dbfd638fbb2ecb87e36f0f954e6fc9da993150bb4f8b61499eec0f25ad509d","observation_id":"b7f34a39-681f-4b87-acea-0fce80f52970","resolution":{"observed_at":"2026-08-10T21:02:34.706338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.633358Z","title":"BEBERT: efficient and robust binary ensemble BERT,","venue":null,"work_id":"44769b06-df90-482c-9ece-37022aa37d6d","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.711245Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7c833c48153b8dc4e13b87a306d3384896e394b051f671899596b1b8dbbc609e","observation_id":"457e28ed-38f0-4f8e-bad8-703c93d922f1","resolution":{"observed_at":"2026-08-10T21:02:35.638419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11851","last_updated":"2024-01-23T04:17:07Z","snapshot_observed_at":"2026-07-06T17:18:40.469815Z","submitted_at":"2024-01-22T11:14:08Z","title":"BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge","version":2},"cited_work":{"arxiv_id":"2401.11851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11851","snapshot_observed_at":"2026-08-10T21:02:35.019644Z","title":"BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge","venue":"cs.AR","work_id":"2792a732-eb8f-4082-8461-736c1bb2ad62","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.716955Z"},"links":{"cited_paper":"/paper/2401.11851","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:35bbcd1750bceeb6a5701efd77f63c88ab07988d30751c92c74160fe3761c383","observation_id":"201f0beb-952d-435f-8d1b-134d2d2ed07d","resolution":{"observed_at":"2026-08-10T21:02:35.025041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.615803Z","title":"Training deep neural networks with 8-bit floating point numbers,","venue":null,"work_id":"cd0b024d-7206-4906-b703-77862a5565f3","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.721805Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:687b972f8f28bd420671b8aae90db71db45bd3b9337cce68cde0a3892ad7e640","observation_id":"53268a6c-2bfa-4786-b202-e8dd5ebf3b44","resolution":{"observed_at":"2026-08-10T21:02:35.620937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01076","last_updated":"2023-07-08T04:29:09Z","snapshot_observed_at":"2026-08-04T00:46:59.105975Z","submitted_at":"2023-06-01T18:32:08Z","title":"Quantization-Aware and Tensor-Compressed Training of Transformers for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":"2306.01076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.01076","snapshot_observed_at":"2026-08-10T21:02:34.995125Z","title":"Quantization-Aware and Tensor-Compressed Training of Transformers for Natural Language Understanding","venue":"cs.CL","work_id":"f1274c36-0bb4-45c9-a5e3-65144ca33111","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.726485Z"},"links":{"cited_paper":"/paper/2306.01076","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:1431ba17881bc047c1c1ed78631ab3640a5d5cdb61867a9d5dc8bfc1c73af7b7","observation_id":"5b8278ff-8f14-4b08-bb71-37e1c3672f58","resolution":{"observed_at":"2026-08-10T21:02:35.002354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.599629Z","title":"LoRETTA: low-rank eco- nomic tensor-train adaptation for ultra-low-parameter fine-tuning of large language models,","venue":null,"work_id":"9a77aa18-763a-48dd-8a81-53e8c5b33392","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.731719Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:33138c60c836fd56b616bf2bc5bb2e5d7e09e76d44b078202550bc36d28312cb","observation_id":"d92fa232-383f-4b18-a693-fe165f333a5a","resolution":{"observed_at":"2026-08-10T21:02:35.605182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.582735Z","title":"AdaZeta: adaptive zeroth-order tensor-train adaption for memory- efficient large language models fine-tuning,","venue":null,"work_id":"625baf45-759c-4453-8471-5f5c4517cc1e","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.736335Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e7798d784703e625aa28f7dc58646546f728f3f47999a33dd9e9443c82e8da33","observation_id":"d98655cd-cae4-4b81-87a1-43f52b441f17","resolution":{"observed_at":"2026-08-10T21:02:35.588268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.564643Z","title":"An algorithm–hardware co-optimized framework for accelerating N: M sparse transformers,","venue":null,"work_id":"342fcfc8-ffd4-45e1-8d80-319da61778d0","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.740905Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:237d7bc1575b8f64b41483125f8103e04c06967fdd41d2a6a57e466852487ad8","observation_id":"ff30906e-4784-4ce0-9e18-36450e02dc32","resolution":{"observed_at":"2026-08-10T21:02:35.569929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.548408Z","title":"Efficient N: M sparse DNN training using algorithm, architecture, and dataflow co-design,","venue":null,"work_id":"223e46ca-477c-45bf-b86c-a895058323ba","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.746477Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:f6346ecb441fa563943435eba51700fdd280970ac31fbbbcdc9999e165f10b41","observation_id":"45151565-c3d7-45dd-b07e-892a0867effa","resolution":{"observed_at":"2026-08-10T21:02:35.554111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.532058Z","title":"MINILM: Deep self-attention distillation for task-agnostic compression of pre- trained transformers,","venue":null,"work_id":"dca9e69d-aedd-40bf-8ef7-d7fed2c1c572","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.751042Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:acd343a2546d3190c7677b6db4b3f6dd947ab8624355f6db145a81c2d467dd47","observation_id":"7eece556-4698-4c72-b56a-e5a6867cab5d","resolution":{"observed_at":"2026-08-10T21:02:35.537384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.514190Z","title":"Wanda++: Pruning large language models via regional gradients,","venue":null,"work_id":"ebd58d89-625b-49f3-8df7-6588f933d0be","year":null},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.755945Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:a217fea57694c9130636ccd787c066098ed7721494600583717e94f4dcf48c94","observation_id":"62622bc6-62d4-4b91-a896-b92258791984","resolution":{"observed_at":"2026-08-10T21:02:35.520222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.497051Z","title":"Compressing dma engine: Leveraging activation sparsity for training deep neural networks,","venue":null,"work_id":"cc9cfbc3-e823-4251-bd75-fc3501fba1b1","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.761118Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:9ed610c1d259df7f96fb508072d1bea685444ec30a2989ca341879f7514ed78f","observation_id":"0dcc4082-d9b2-4a2f-a74d-81c3f96b9d0b","resolution":{"observed_at":"2026-08-10T21:02:35.502722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.765940Z","title":"Quantized neural networks: Training neural networks with low pre- cision weights and activations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.765940Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:25d010266bde7cd012f3c3231986d62b393e5dde984d2534a4138756a83eb15e","observation_id":"11406047-74c2-4dec-8000-1a81249c299c","resolution":{"observed_at":"2026-08-10T21:02:34.765940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.469717Z","title":"Deep learning with limited numerical precision,","venue":null,"work_id":"9cc72a98-f1b6-490d-b1fb-ba42671a56f8","year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.770934Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:5eb60564f2848fa6c2bebf58407b477546957e737064e312f29d5388e46c777d","observation_id":"cb9ac2de-89c6-42cb-b596-2e677cfb0945","resolution":{"observed_at":"2026-08-10T21:02:35.475381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.453424Z","title":"Ultra- low precision 4-bit training of deep neural networks,","venue":null,"work_id":"5f003c1c-8cae-4be8-b87d-f4c1b1bbceac","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.775666Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:dc290c05990d67500c026b39d9d3e32ff24f58509d3e46ee95994e0ab8d87ebc","observation_id":"d7362667-e6c8-4998-b561-0d56ff1dec9e","resolution":{"observed_at":"2026-08-10T21:02:35.458527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.780461Z","title":"Tensor decompositions and applications,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.780461Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:1c952415284a97d1fd7e68f7defe1b1c42a608c932c5d6a4fd79b91cb55c5a2e","observation_id":"771ee7b0-59ad-40c6-99e9-bf8f11d8e090","resolution":{"observed_at":"2026-08-10T21:02:34.780461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.424883Z","title":"Speeding-up convolutional neural networks using fine-tuned cp- decomposition,","venue":null,"work_id":"1236c734-90c0-40b3-92e6-89042a88221a","year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.784569Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:197c0cf90959ca88a39e731c9db4fdb9e525173f1edc9a568fdc2fd1e1f3dd6e","observation_id":"296d507f-1d22-48c6-987a-8c7719f6e57d","resolution":{"observed_at":"2026-08-10T21:02:35.430776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06530","last_updated":"2016-02-24T11:52:12Z","snapshot_observed_at":"2026-07-06T04:37:12.487978Z","submitted_at":"2015-11-20T09:20:08Z","title":"Compression of Deep Convolutional Neural Networks for Fast and Low Power Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06530","snapshot_observed_at":"2026-08-10T21:02:34.789038Z","title":"Compression of deep convolutional neural networks for fast and low power mobile applications,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.789038Z"},"links":{"cited_paper":"/paper/1511.06530","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:23beeead9556fb9275b6beab5a4a39f2aab5d83eaf33e1ada08d6e42367eef26","observation_id":"9602d4be-65ce-4962-bb6e-9ecfb9e2f3ef","resolution":{"observed_at":"2026-08-10T21:02:34.789038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.407548Z","title":"Fast video facial expression recognition by deeply tensor-compressed LSTM neural network on mobile device,","venue":null,"work_id":"0fdc8051-b149-4959-b024-a1039a1f1a06","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.793571Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:241681f8af9d9bb1119d816debe8b1b8859859495c51e2a632c0701d6f719143","observation_id":"75f57b58-d873-4cca-bea8-9d6b4f68abd7","resolution":{"observed_at":"2026-08-10T21:02:35.413299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.797827Z","title":"Tensorizing neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.797827Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:5baee44357672f64b368dab3ea9ed763136c3c584d124745daf7734e97508673","observation_id":"ec34acf0-f02b-4dab-aa08-215738260a02","resolution":{"observed_at":"2026-08-10T21:02:34.797827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.06133","last_updated":"2020-01-06T10:41:42Z","snapshot_observed_at":"2026-08-10T17:50:11.805076Z","submitted_at":"2019-03-14T17:19:38Z","title":"Compression and Interpretability of Deep Neural Networks via Tucker Tensor Layer: From First Principles to Tensor Valued Back-Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.06133","snapshot_observed_at":"2026-08-10T21:02:34.801878Z","title":"Compression and interpretability of deep neural networks via Tucker tensor layer,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.801878Z"},"links":{"cited_paper":"/paper/1903.06133","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:16de3daab4666360ecb6ef7cf1efce3c372de397fd18d28b6c696c7202b5f2b7","observation_id":"7ae86d44-fdf6-4f37-be79-681521f0a82e","resolution":{"observed_at":"2026-08-10T21:02:34.801878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.379550Z","title":"Tensorized embedding layers,","venue":null,"work_id":"3ec204fc-0b2e-4cd5-86f7-f35c0896c570","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.806898Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:a1d7206e85bcdcb80d3156478e90350c56ee7eac17e50bb374d913b489f73161","observation_id":"fd986210-88d2-4823-84ad-cd7a985e039b","resolution":{"observed_at":"2026-08-10T21:02:35.384401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.364334Z","title":"A tensorized transformer for language modeling,","venue":null,"work_id":"2cab60c5-4153-47e8-b102-234d7e18a5a8","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.811317Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e8481ba7dc317d59ea3205380bcf6bdb083bbf2e01b7405178e685687ac85b97","observation_id":"1533a14d-c31f-4feb-8d1e-457bf8b41757","resolution":{"observed_at":"2026-08-10T21:02:35.369241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.348017Z","title":"TIE: energy- efficient tensor train-based inference engine for deep neural network,","venue":null,"work_id":"37e91eee-3e40-4618-9c70-a6d95ed11921","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.815771Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:c4eb40dbd08c43d1496ef3e875b8e5a4c9951c1b98b4b89d7473b8be2788a68d","observation_id":"eb7b8697-aa6d-4699-a0bd-2b0b95f473b9","resolution":{"observed_at":"2026-08-10T21:02:35.353610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.332041Z","title":"ETTE: Efficient tensor-train-based computing engine for deep neural networks,","venue":null,"work_id":"b41f136c-3384-4226-8d7f-cb91d9ef6f25","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.820252Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:a6c81da1d68bf7400192f58ccf77f80af9f417363cdad0cfd7dd01914b5e290c","observation_id":"f5569ca4-54fa-404b-89f4-90bf425e5a61","resolution":{"observed_at":"2026-08-10T21:02:35.337043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.315818Z","title":"TT-CIM: Tensor train decomposition for neural network in rram-based compute-in-memory systems,","venue":null,"work_id":"81adf333-03af-41c3-beba-9d975c771af2","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.824858Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:3f8311b385aecba15806680b5fba656a4a7dcac91f6817b861e47ca4a45684be","observation_id":"10e84211-9999-45b6-97d1-9f890d0e4298","resolution":{"observed_at":"2026-08-10T21:02:35.320717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.299196Z","title":"15.4 a 5.99-to-691.1 TOPS/W tensor-train in- memory-computing processor using bit-level-sparsity-based optimiza- tion and variable-precision quantization,","venue":null,"work_id":"0e2407e8-fe81-40da-ac18-65ce7365dfd1","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.829680Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:61f94e3d1eb6fc62c6be49d5ba750663611da43b01e78be4ecbfe3e2ade80687","observation_id":"74892902-0616-4bf2-8e3b-06ea6f009722","resolution":{"observed_at":"2026-08-10T21:02:35.304332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09858","last_updated":"2023-10-09T18:00:00Z","snapshot_observed_at":"2026-07-06T16:07:53.214338Z","submitted_at":"2023-08-18T23:56:50Z","title":"Tensor-Compressed Back-Propagation-Free Training for (Physics-Informed) Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09858","snapshot_observed_at":"2026-08-10T21:02:34.835075Z","title":"Tensor- compressed back-propagation-free training for (physics-informed) neural networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.835075Z"},"links":{"cited_paper":"/paper/2308.09858","citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:8f1d889692c8f1b738eb064a177ab32513a89e60fdf2b53e9a8c81875655919c","observation_id":"e3fff906-6096-47df-ad95-f3b2bf22f713","resolution":{"observed_at":"2026-08-10T21:02:34.835075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.283608Z","title":"Tensorized optical multimodal fusion network,","venue":null,"work_id":"f1f12c64-202c-4318-b39c-13a7150843fe","year":2023},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.839943Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:075107a96a71c6de4fd085ca3f3e30b2b981833a532b5a43dd6f763b38e9178b","observation_id":"e476048e-7405-4180-88bb-dad5d61f9f07","resolution":{"observed_at":"2026-08-10T21:02:35.288931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.266472Z","title":"Real-time fj/mac pde solvers via tensorized, back- propagation-free optical pinn training,","venue":null,"work_id":"89a15ba2-2d05-41ec-b3a3-ad832d7d4cf4","year":null},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.845661Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:6216ba7f84e69b6bf30c041ee46183e9a7b9ad8425f5fb4e6aab0715db2c9b57","observation_id":"760367ca-702b-4081-98ce-9fadeb891b15","resolution":{"observed_at":"2026-08-10T21:02:35.271957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.250956Z","title":"The ATIS spoken language systems pilot corpus,","venue":null,"work_id":"22f10c05-fa3c-4b27-a618-cb1b6fbc2666","year":1990},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.850857Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:2e83f6ddc450bc197407cc359e87f5c3923ec23e1d33c7e45e54db575af15b19","observation_id":"4977035e-3445-4fcd-8817-9bdf888cdefb","resolution":{"observed_at":"2026-08-10T21:02:35.255993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:34.855807Z","title":"Tensor-train decomposition,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.855807Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:f7bc8182da8c2830e2a1d0b565b550a17ac0ad8869136e0282c0b2e7cc60ccc6","observation_id":"787095f8-228b-43dd-ab3b-e935d0306018","resolution":{"observed_at":"2026-08-10T21:02:34.855807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.225398Z","title":"Tensor-train recurrent neural net- works for video classification,","venue":null,"work_id":"ae70babe-52b1-477b-9934-b9aa7944e3a2","year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.860510Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:367712f9c8e34d4867eec16202e57c11a7f88ae77f2f4821ac81e2cd380f64c4","observation_id":"84beec9b-31e1-4cc9-857f-1e28901aae08","resolution":{"observed_at":"2026-08-10T21:02:35.230465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.210319Z","title":"Learning compact recurrent neural networks with block-term tensor decompo- sition,","venue":null,"work_id":"d5cfd755-8b94-423e-8477-f24e149faf52","year":2018},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.865236Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:fd265c7b771bb68d6f9f14a7e1844fefcc4eb152245b136c48c5f7407f3b48ee","observation_id":"f6012b34-4f7d-441d-a7cd-af7b8c441173","resolution":{"observed_at":"2026-08-10T21:02:35.215107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.194936Z","title":"Towards compact neural networks via end-to-end training: A Bayesian tensor approach with automatic rank determination,","venue":null,"work_id":"b44c9b56-faf2-4104-ab2e-86028b0c8a0f","year":2022},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.870400Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e3e25978d368950789b04d584dbc4fa83b61b16066270aea0906044e3543e503","observation_id":"0808fd52-35a3-4acd-be49-6e3a8b198d0c","resolution":{"observed_at":"2026-08-10T21:02:35.199924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.180450Z","title":"Bayesian tensorized neural networks with automatic rank selection,","venue":null,"work_id":"0311caef-1f0e-4903-8c4d-8fc56678cfb4","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.875116Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7eb69e5d6a704819f357b39b7459673ca7eb299fd78f17079cb8ac7d49954414","observation_id":"3cb058de-3320-459c-86b2-e51f08f14a82","resolution":{"observed_at":"2026-08-10T21:02:35.184999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.165449Z","title":"Compressing 3D CNNs based on tensor train decomposition,","venue":null,"work_id":"abcec6e9-f69f-46be-ad94-378540ce3b25","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.879762Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:e184081d5660580373b07cc0c9e77ab4b0859c73258b1321825355f8a595fb5b","observation_id":"8b321dcc-e70b-469d-8449-ac5f6d2f3161","resolution":{"observed_at":"2026-08-10T21:02:35.170445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.148282Z","title":"Nonlinear tensor train format for deep neural network compression,","venue":null,"work_id":"ee92d001-9f1c-4069-96cb-07c5e308c1af","year":2021},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.884097Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:7bdd78e854fc59728e9b3c18aa6181b76743eaa7e1860f685a82e7d6164309ad","observation_id":"c2f7b994-8d20-4ea8-827a-0ec5374e1923","resolution":{"observed_at":"2026-08-10T21:02:35.154340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.132070Z","title":"CoMERA: Computing-and memory-efficient training via rank-adaptive tensor optimization,","venue":null,"work_id":"40177f99-2855-4f30-bfe2-a71e68236cfd","year":2024},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.888393Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:638143a7064ca3750667e6d51d62d20625848d5cbc28dcfd028a7cd8bd434471","observation_id":"a07ed29c-6697-4acd-8162-6332b808ec5c","resolution":{"observed_at":"2026-08-10T21:02:35.136889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.116224Z","title":"An FPGA-based processor for training convolutional neural networks,","venue":null,"work_id":"64801730-0f57-43d5-b01a-f36b6fd24901","year":2017},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.892435Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:bba76b7e9fc925f5bab3647e7ab4439d371a1a0b111dd118aa30d9e31e08e1d0","observation_id":"d0fd9345-174b-4ce1-b0da-e0f801bac2b1","resolution":{"observed_at":"2026-08-10T21:02:35.121361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.100576Z","title":"Automatic compiler based FPGA accelerator for CNN training,","venue":null,"work_id":"f7a8417f-42d5-46b5-8080-cc9193006218","year":2019},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.896674Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:0d8289999ac95431f4705026601e06c95b152ee87ca79b4563382e88a16dc847","observation_id":"1505b83c-b241-4ee2-ba12-8d8c38345706","resolution":{"observed_at":"2026-08-10T21:02:35.105553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.084972Z","title":"FPGA-based low-batch training accelerator for modern CNNs featuring high bandwidth memory,","venue":null,"work_id":"a99a6271-3468-4586-ad06-cddd4891eeb7","year":2020},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.901239Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:bacbbb74a52a498b84c8e9656350736891d70621e36412101d9af51ee69a58c2","observation_id":"c563c2d9-fcea-4869-b147-b062f291e149","resolution":{"observed_at":"2026-08-10T21:02:35.089897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:02:35.070456Z","title":"for leadership in research and development on circuits and processes for the evolution of microprocessors","venue":null,"work_id":"57acfd1f-da56-449c-8672-39e5d1ce86ea","year":2009},"citing_paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization","version":2},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:34.906180Z"},"links":{"citing_paper":"/paper/2501.06663"},"observation_digest":"sha256:4c3491ce23c43b2b5d637f0505b52e0c5078b5756082715f3fade33b8d4ccff8","observation_id":"1ed1fc16-e507-47e4-9e6e-f0eafa3719ba","resolution":{"observed_at":"2026-08-10T21:02:35.075105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06663","last_updated":"2025-08-06T17:33:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T20:53:29.360090Z","submitted_at":"2025-01-11T23:29:51Z","title":"Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2501.06663."}