{"as_of":"2026-08-22T14:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ea7e4e6e8376ace2fc68d9e1947d036617f05945d32b3ec0185ed222622b1d6","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:57:01.474744Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:08:50.198349Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T01:39:23.983217Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2602.01785","last_updated":"2026-08-14T09:39:49Z","snapshot_observed_at":"2026-08-19T23:09:06.003911Z","submitted_at":"2026-02-02T08:10:21Z","title":"Seeing is Coding: On the Effectiveness of Vision Language Models in Code Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:30:50.984873Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2602.01785"},"observation_digest":"sha256:028174ccfe8bb67be04269b5ef0405eedacecd93b798044fc449f0619ee11b42","observation_id":"3341d6c6-0ef6-4ef8-8e24-9eebefe90515","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2603.16877","last_updated":"2026-04-28T06:59:31Z","snapshot_observed_at":"2026-08-16T01:08:55.101278Z","submitted_at":"2026-02-18T20:54:23Z","title":"Enhancing Financial Report Question-Answering: A Retrieval-Augmented Generation System with Reranking Analysis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T20:58:11.734614Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2603.16877"},"observation_digest":"sha256:3ad376f0fd8f15ee3f8fe08826aff2be2575bc84bc26da13a027a808d75b86ad","observation_id":"fa9d14d3-cefb-4de9-b63e-dc87cb83375b","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2604.13453","last_updated":"2026-04-15T04:05:10Z","snapshot_observed_at":"2026-08-17T18:33:23.267592Z","submitted_at":"2026-04-15T04:05:10Z","title":"FAST: A Synergistic Framework of Attention and State-space Models for Spatiotemporal Traffic Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:21.472989Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2604.13453"},"observation_digest":"sha256:1ea29c4ae0f404f5a7806487a6233481d786f1545dd70e3c6173d9f7a22d07fa","observation_id":"842d82f3-b450-4671-aea3-64053c5a86f1","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2604.17898","last_updated":"2026-04-20T07:17:59Z","snapshot_observed_at":"2026-08-13T09:08:58.400058Z","submitted_at":"2026-04-20T07:17:59Z","title":"ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T04:41:23.980996Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2604.17898"},"observation_digest":"sha256:b6aa83bffa8fd66cacaa45745e7218d78de873c98a1e9c6c3587291786aeb5f4","observation_id":"6fb7a056-658b-4c7c-a1c9-0be73d2b56c9","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2604.18037","last_updated":"2026-04-20T10:02:18Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T10:02:18Z","title":"HABIT: Chrono-Synergia Robust Progressive Learning Framework for Composed Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T04:50:51.806532Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2604.18037"},"observation_digest":"sha256:c3996101b0fe1e81baef12a81f7d4c35360234b079b5f904d52a6384c6e7c8f4","observation_id":"a5f3fcdf-542b-4100-a9d4-55a83510e920","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2604.18051","last_updated":"2026-04-20T10:19:07Z","snapshot_observed_at":"2026-08-14T11:16:23.623482Z","submitted_at":"2026-04-20T10:19:07Z","title":"INTENT: Invariance and Discrimination-aware Noise Mitigation for Robust Composed Image Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T04:41:57.207279Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2604.18051"},"observation_digest":"sha256:bedd481b219a65ae4bf5ff20f7fd02550f05964410b7c4b7e4123d2353dc2c30","observation_id":"94bda9df-d700-40c7-aa4b-259c3dcef9e9","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2604.20358","last_updated":"2026-04-22T08:59:21Z","snapshot_observed_at":"2026-08-02T15:48:26.636680Z","submitted_at":"2026-04-22T08:59:21Z","title":"ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T00:47:18.249980Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2604.20358"},"observation_digest":"sha256:a288c386ad48defc3e8dc35592f70d7a052d61db80697004459a5804ca518495","observation_id":"9b5e565e-09ca-4e43-8f43-e116f6e625ad","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2604.26283","last_updated":"2026-07-02T12:22:56Z","snapshot_observed_at":"2026-08-11T12:22:37.659078Z","submitted_at":"2026-04-29T04:23:35Z","title":"MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T09:10:28.244690Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2604.26283"},"observation_digest":"sha256:4299eef501bd87b6c8083189594860e8dfeeef9da63673276704fe1bfc0cff5c","observation_id":"d06e6fc3-dc44-4168-a7a0-eec8e89e4998","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2604.26283","last_updated":"2026-07-02T12:22:56Z","snapshot_observed_at":"2026-08-11T12:22:37.659078Z","submitted_at":"2026-04-29T04:23:35Z","title":"MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-04T01:35:11.966506Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2604.26283"},"observation_digest":"sha256:41fb9a37cdd19f2a998364e8ce6e04b9d0d6b61d7949087fdfa0679890e06f77","observation_id":"8e7782ad-0235-49b8-8477-de925962f1e1","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2605.09253","last_updated":"2026-07-01T02:40:56Z","snapshot_observed_at":"2026-08-13T01:26:47.116950Z","submitted_at":"2026-05-10T01:41:43Z","title":"Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T22:52:01.824412Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2605.09253"},"observation_digest":"sha256:c4d6845688e3275bd004ac04bbfbaee049f74bf914542a6b1c097da6debe9920","observation_id":"8d95c99b-52ae-4004-95e9-75f6ab9a4915","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2605.09253","last_updated":"2026-07-01T02:40:56Z","snapshot_observed_at":"2026-08-13T01:26:47.116950Z","submitted_at":"2026-05-10T01:41:43Z","title":"Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-02T23:34:26.508233Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2605.09253"},"observation_digest":"sha256:fc01945ed53c20acf2cb75d2826ff24560d44009f415a9513f0777e5fa3c785b","observation_id":"ffa351cb-2c2f-40dd-9279-6eff311d369d","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2605.26382","last_updated":"2026-05-25T23:01:37Z","snapshot_observed_at":"2026-08-13T03:14:56.853915Z","submitted_at":"2026-05-25T23:01:37Z","title":"Detail Consistent Stage-Wise Distillation for Efficient 3D MRI Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:11:06.158442Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2605.26382"},"observation_digest":"sha256:559ef5c2e7e636104093dc23fe03c89aa727f8a41fd93549cd6b2dc6097a36a8","observation_id":"b2e09a40-803a-4e26-98ac-4a95023b124e","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":"2512.02924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-07-21T02:20:32.885266Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","venue":null,"work_id":"f4cd1c86-d38c-4cac-a1a4-502fbdcd8103","year":2025},"citing_paper":{"arxiv_id":"2606.11257","last_updated":"2026-06-09T01:09:00Z","snapshot_observed_at":"2026-08-16T12:40:30.910722Z","submitted_at":"2026-06-09T01:09:00Z","title":"Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:46:46.866049Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2606.11257"},"observation_digest":"sha256:4182279fbdb0cb1b333928513531be91cb1586dd190c6a824d71591df5182a9a","observation_id":"fc40c1a1-6a4f-4334-b250-952f65128a35","resolution":{"observed_at":"2026-07-21T02:20:32.885266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02924","snapshot_observed_at":"2026-08-02T11:08:50.198349Z","title":"Autoneural: Co-designing vision-language models for npu inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27214","last_updated":"2026-06-16T01:31:14Z","snapshot_observed_at":"2026-08-15T21:31:14.855465Z","submitted_at":"2026-06-16T01:31:14Z","title":"Estimating Treatment Effects for Depression in Longitudinal Therapy Switching Settings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T11:08:50.198349Z"},"links":{"cited_paper":"/paper/2512.02924","citing_paper":"/paper/2607.27214"},"observation_digest":"sha256:855ea8fb4f39f8e8527f35f487fef75438c6d9daefcc583938fa33a19cd373ed","observation_id":"5794d1a3-4a67-4308-a9f3-0faeab962db2","resolution":{"observed_at":"2026-08-02T11:08:50.198349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.02924/citation-record","integrity":"/paper/2512.02924/integrity","json":"/paper/2512.02924/citation-record.json","paper":"/paper/2512.02924"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11475","snapshot_observed_at":"2026-08-03T18:56:56.607192Z","title":"Omnivlm: A token-compressed, sub-billion-parameter vision- language model for efficient on-device inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:56.607192Z"},"links":{"cited_paper":"/paper/2412.11475","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:adc8e486314cc28cc5c4a380d5342473b1ee3cd6326f7213522dafe50c2bde25","observation_id":"77ac84e2-5936-4016-a7af-df25475e5e91","resolution":{"observed_at":"2026-08-03T18:56:56.607192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-03T18:56:56.759878Z","title":"Smolvlm: Redefining small and efficient multimodal models.arXiv preprint arXiv:2504.05299, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:56.759878Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:795ddcd7cf2307be39ae2ed200cac97612daa8708a1f416ca2f0ba3c0c6e3bde","observation_id":"2ff689b0-f582-497f-a1a3-eedbd47f972b","resolution":{"observed_at":"2026-08-03T18:56:56.759878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T18:56:56.861742Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:56.861742Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:16df62b200d1cfed8a527689cb4f1608b5a8d69de7e403fb84688e71da5a7353","observation_id":"b638c712-ced3-4fb1-8798-01424a173b3b","resolution":{"observed_at":"2026-08-03T18:56:56.861742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:56.925070Z","title":"Vision-language models for vision tasks: A survey.IEEE transactions on pattern analysis and machine intelligence, 46(8):5625–5644, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:56.925070Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:125006f60707dc694141f19df3c9722e012b7c7c851d2e6512891504fe804c28","observation_id":"8d0277b5-62ef-4b2e-827b-b460d45f71b9","resolution":{"observed_at":"2026-08-03T18:56:56.925070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.020196Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions.arXiv preprint arXiv:2404.07214, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.020196Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:5ed85ff5a4410e80c9540033030f70f08ec652a1205155aaebe265209bc5104b","observation_id":"5981f1b3-5d7e-486a-8142-38ecd79ce7b4","resolution":{"observed_at":"2026-08-03T18:56:57.020196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.087593Z","title":"Efficient execution of deep neural networks on mobile devices with npu","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.087593Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:c87399bd268ced795b334b5128aa8346260958d09a173af3c198279fe75ff81d","observation_id":"73f17bc5-82b1-47ad-b161-6e87229b5bb9","resolution":{"observed_at":"2026-08-03T18:56:57.087593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.161966Z","title":"A survey on neural network hardware accelerators.IEEE Transac- tions on Artificial Intelligence, 5(8):3801–3822, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.161966Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:6fb4d520182d7df302b144ee78392df2a7ef7f3b91cdf05963702a5691194081","observation_id":"1e1888a2-ba15-4154-acbe-4c0214dda1ec","resolution":{"observed_at":"2026-08-03T18:56:57.161966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.243560Z","title":"Architecture of neural processing unit for deep neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.243560Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:9860c9aeefb4a1f2034b45464cb0c9b1998002eb2472ca5b15c91891e4d1ff18","observation_id":"e882f080-dca6-4490-b72e-cbbdefc7a946","resolution":{"observed_at":"2026-08-03T18:56:57.243560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.373502Z","title":"Transformers in vision: A survey.ACM computing surveys (CSUR), 54(10s):1–41, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.373502Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:8cffe43aebe4d97a3e1684fcb4b6379ba6f10974833ee9a2ecb324f79585210a","observation_id":"e3fa1a44-1735-48b3-8174-4ac2aa123766","resolution":{"observed_at":"2026-08-03T18:56:57.373502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10407","last_updated":"2024-04-16T09:19:11Z","snapshot_observed_at":"2026-08-18T13:10:30.130439Z","submitted_at":"2024-04-16T09:19:11Z","title":"Comprehensive Survey of Model Compression and Speed up for Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10407","snapshot_observed_at":"2026-08-03T18:56:57.460747Z","title":"Comprehensive survey of model compression and speed up for vision transformers.arXiv preprint arXiv:2404.10407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.460747Z"},"links":{"cited_paper":"/paper/2404.10407","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:c85010563f9bf6a2547197b92a0b2396984b6639b4847b5682f53c72b1e84622","observation_id":"f9e98a47-1e23-4861-881c-5482f1b716cc","resolution":{"observed_at":"2026-08-03T18:56:57.460747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.538815Z","title":"Understanding and improving layer normalization.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.538815Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:9a4070aa9ea5c4e516b2f0b237f3b9d53a7a0d6ae6dbc1415719afa567273b94","observation_id":"a8319bc8-299b-425b-b181-0f7fe8d80464","resolution":{"observed_at":"2026-08-03T18:56:57.538815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08659","last_updated":"2023-11-28T16:06:59Z","snapshot_observed_at":"2026-08-16T21:20:07.431044Z","submitted_at":"2023-10-12T18:34:08Z","title":"LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08659","snapshot_observed_at":"2026-08-03T18:56:57.627233Z","title":"Loftq: Lora-fine-tuning-aware quantization for large language models.arXiv preprint arXiv:2310.08659, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.627233Z"},"links":{"cited_paper":"/paper/2310.08659","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:c01c971739b396c3864680cb6ea2e16c27b65587ff8cd4d331ea41a388612363","observation_id":"bd700577-3454-4994-b342-9aed805def73","resolution":{"observed_at":"2026-08-03T18:56:57.627233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06385","last_updated":"2024-09-03T16:36:06Z","snapshot_observed_at":"2026-08-18T10:07:02.146641Z","submitted_at":"2024-06-10T15:44:22Z","title":"Low-Rank Quantization-Aware Training for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06385","snapshot_observed_at":"2026-08-03T18:56:57.732475Z","title":"Low-rank quantization-aware training for llms.arXiv preprint arXiv:2406.06385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.732475Z"},"links":{"cited_paper":"/paper/2406.06385","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:73241b93c2644077b9a08b1515afc3dd96f40e45acc34354541048993d4952c4","observation_id":"989058f6-8f66-45a9-b492-b020fc034f65","resolution":{"observed_at":"2026-08-03T18:56:57.732475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.838469Z","title":"Efficien- tqat: Efficient quantization-aware training for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.838469Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:9694d24dfc05b1cc5de568faa75ae38249cf10824726e4fc03949884c12c21b2","observation_id":"cd507273-49c2-4f55-8eb1-f991f19a42c6","resolution":{"observed_at":"2026-08-03T18:56:57.838469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:57.962432Z","title":"Vlm-auto: Vlm-based autonomous driving assistant with human-like behavior and understanding for complex road scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:57.962432Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:bcdc2b28abb59eebad047750cb3852cd30d0b9c12b21668e99be921f264e1384","observation_id":"6313c0a1-ee1f-4d92-9c44-6ee558386ae3","resolution":{"observed_at":"2026-08-03T18:56:57.962432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15544","last_updated":"2024-12-20T04:08:11Z","snapshot_observed_at":"2026-08-19T21:36:18.517895Z","submitted_at":"2024-12-20T04:08:11Z","title":"VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15544","snapshot_observed_at":"2026-08-03T18:56:58.078201Z","title":"Vlm-rl: A unified vision lan- guage models and reinforcement learning framework for safe autonomous driving.arXiv preprint arXiv:2412.15544, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.078201Z"},"links":{"cited_paper":"/paper/2412.15544","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:79de308511affc4ff4438044aed5f5e9ef21fd4a23c9c98986c5205b81d3c52a","observation_id":"b57e86bd-7545-46b9-8b81-d17fe70ea8f7","resolution":{"observed_at":"2026-08-03T18:56:58.078201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:58.209786Z","title":"Octopus v3: Technical report for on-device sub-billion multimodal ai agent,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.209786Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:76a29b981008871ca5bea8aa4bf550e02e2e9c111bfa7643a357c3bdf2b9e333","observation_id":"6c4b1558-51df-459a-b4c9-adf5e45530d9","resolution":{"observed_at":"2026-08-03T18:56:58.209786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:58.468278Z","title":"Octopus: On-device language model for function calling of software APIs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.468278Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:4f04e1a14f1fc40f5d4c8794076d5af855c9de67da5ba00814cbef948d8acf68","observation_id":"67f3cbb7-37e9-4d32-8331-1eb6bb017893","resolution":{"observed_at":"2026-08-03T18:56:58.468278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01744","last_updated":"2026-07-20T02:23:52Z","snapshot_observed_at":"2026-08-18T16:50:50.678954Z","submitted_at":"2024-04-02T09:01:32Z","title":"Octopus v2: On-device language model for super agent","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01744","snapshot_observed_at":"2026-08-03T18:56:58.585038Z","title":"Octopus v2: On-device language model for super agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.585038Z"},"links":{"cited_paper":"/paper/2404.01744","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:c270b101614b9539031d963fd8820f8342a586c3cf943fc396c5eff2eac02bcb","observation_id":"bba0c969-6aba-4658-8e76-95ef6b6a8474","resolution":{"observed_at":"2026-08-03T18:56:58.585038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19296","last_updated":"2026-07-20T02:16:43Z","snapshot_observed_at":"2026-08-16T13:56:43.746638Z","submitted_at":"2024-04-30T06:55:45Z","title":"Octopus v4: Graph of language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19296","snapshot_observed_at":"2026-08-03T18:56:58.678379Z","title":"Octopus v4: Graph of language models.arXiv preprint arXiv:2404.19296, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.678379Z"},"links":{"cited_paper":"/paper/2404.19296","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:24b7326b6e8c0b41a6633785530dcf6a5e5d18e204c64737791837448ab615eb","observation_id":"210c1b66-a807-4b58-8c79-b1bf46766a4d","resolution":{"observed_at":"2026-08-03T18:56:58.678379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18082","last_updated":"2026-07-20T02:13:43Z","snapshot_observed_at":"2026-08-16T13:39:33.076271Z","submitted_at":"2024-06-26T05:40:10Z","title":"Octo-planner: On-device Language Model for Planner-Action Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18082","snapshot_observed_at":"2026-08-03T18:56:58.756838Z","title":"Octo-planner: On-device language model for planner-action agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.756838Z"},"links":{"cited_paper":"/paper/2406.18082","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:0737fb2680cf9b649e94b55abc18511e6255adcb9d05c129248c853c446ec959","observation_id":"93d10921-7a66-433d-8241-035b209138a5","resolution":{"observed_at":"2026-08-03T18:56:58.756838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15518","last_updated":"2026-07-20T02:08:41Z","snapshot_observed_at":"2026-08-16T13:23:19.632319Z","submitted_at":"2024-08-28T04:06:14Z","title":"Squid: Long Context as a New Modality for Energy-Efficient On-Device Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15518","snapshot_observed_at":"2026-08-03T18:56:58.816760Z","title":"Squid: Long context as a new modality for energy- efficient on-device language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.816760Z"},"links":{"cited_paper":"/paper/2408.15518","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:0aee305533fec9352d9e0a0c66d9af27191d268e3a37742721b5aec7953a3bd6","observation_id":"ea30d657-4fb8-4e19-8228-4ce659a998fd","resolution":{"observed_at":"2026-08-03T18:56:58.816760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:58.910460Z","title":"Edge-side npu inference optimization: Adaptation research of multimodal large models on qualcomm platforms.Intelligent Data Analysis, page 1088467X251342172, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.910460Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:051f3ca23cc7e78631c446443af15669d3d6fc39192700320253e2f0b477ceea","observation_id":"df68b037-a5a3-4393-abe3-f668962bf51b","resolution":{"observed_at":"2026-08-03T18:56:58.910460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:58.978803Z","title":"Fast on- device llm inference with npus","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.978803Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:6095e8ca4f365b162e741d4996e637d35221735a4eec6fe51074601fbc8516f3","observation_id":"3d3ce413-9f09-4c4d-a4ca-f71e254c7d1c","resolution":{"observed_at":"2026-08-03T18:56:58.978803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:59.072110Z","title":"Overviewing ai-dedicated hardware for on-device ai in smartphones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.072110Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:7785dd491b637ef6770723140f3ec810992cf2eec0c68918084840fb69cac359","observation_id":"b3f0b065-7e84-4aff-b08d-0fcfc0d8a2ac","resolution":{"observed_at":"2026-08-03T18:56:59.072110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:59.153925Z","title":"Advances in the neural network quantization: A comprehensive review.Applied Sciences, 14(17):7445, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.153925Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:ef2cf39c27227e5d70ff8eaef2cb3cf41867823e035512dda67d722a2dbd27ed","observation_id":"533f2c81-fd93-4db0-9853-7d183a0ce250","resolution":{"observed_at":"2026-08-03T18:56:59.153925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:59.239533Z","title":"Pruning deep neural networks for green energy-efficient models: A survey.Cognitive Computation, 16(6):2931–2952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.239533Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:7e025da6f2496d6f6a9d104cd9b7dc1d5dd67d97f5833af16a0ceb9cebef0cec","observation_id":"626eb763-fabb-43d0-8f1a-1ef795a8cb55","resolution":{"observed_at":"2026-08-03T18:56:59.239533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:59.303455Z","title":"A comprehensive review of model compression techniques in machine learning.Applied Intelligence, 54(22): 11804–11844, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.303455Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:66e05603fdee4606f718b4831bdf9796cde1d0be15dc4903edd4ce5888976f83","observation_id":"dee8fbc4-f1aa-4cb6-83d1-6b4cab2ebb4e","resolution":{"observed_at":"2026-08-03T18:56:59.303455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17728","last_updated":"2025-02-24T23:42:37Z","snapshot_observed_at":"2026-08-16T12:55:33.056672Z","submitted_at":"2025-02-24T23:42:37Z","title":"LLM Inference Acceleration via Efficient Operation Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17728","snapshot_observed_at":"2026-08-03T18:56:59.405172Z","title":"Llm inference acceleration via efficient operation fusion.arXiv preprint arXiv:2502.17728, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.405172Z"},"links":{"cited_paper":"/paper/2502.17728","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:e0ddd7296c9741d738db6f2d07166a0523e037685fff8e579ddd2e46bd26b1a5","observation_id":"3263cffe-dceb-4770-9a3c-64e553bb318b","resolution":{"observed_at":"2026-08-03T18:56:59.405172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-15T11:50:56.372845Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01380","snapshot_observed_at":"2026-08-03T18:56:59.496372Z","title":"Efficient llm inference using dynamic input pruning and cache-aware masking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.496372Z"},"links":{"cited_paper":"/paper/2412.01380","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:29ac52040ffa65846acb3919737ef1bd674abc63ec34d34b7ede88f071f5eaff","observation_id":"b1490825-f9dd-4591-a84c-a20a207d8aab","resolution":{"observed_at":"2026-08-03T18:56:59.496372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09730","last_updated":"2025-06-24T15:42:55Z","snapshot_observed_at":"2026-08-16T12:50:38.010163Z","submitted_at":"2025-03-12T18:20:47Z","title":"Local Look-Ahead Guidance via Verifier-in-the-Loop for Automated Theorem Proving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09730","snapshot_observed_at":"2026-08-03T18:56:59.559898Z","title":"Local look-ahead guidance via verifier-in- the-loop for automated theorem proving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.559898Z"},"links":{"cited_paper":"/paper/2503.09730","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:11b53699b495811b7811e067c8a3c46879ab26af0ccb733bf2b8b241cbd2f3c8","observation_id":"4bcc1189-7c2b-44cb-98a4-cfd2ee78baeb","resolution":{"observed_at":"2026-08-03T18:56:59.559898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09757","last_updated":"2025-01-16T18:59:53Z","snapshot_observed_at":"2026-08-14T20:39:52.547885Z","submitted_at":"2025-01-16T18:59:53Z","title":"Distilling Multi-modal Large Language Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09757","snapshot_observed_at":"2026-08-03T18:56:59.636047Z","title":"Patel, and Fatih Porikli","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.636047Z"},"links":{"cited_paper":"/paper/2501.09757","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:208c6f779f029b36318f5ed2868c079d9251bcc9585e57436f9b0bc1dad61586","observation_id":"c4c8cd31-f2d0-482c-ab21-0f27388bbf1f","resolution":{"observed_at":"2026-08-03T18:56:59.636047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16559","last_updated":"2025-02-04T18:43:24Z","snapshot_observed_at":"2026-08-16T11:30:35.542639Z","submitted_at":"2025-01-27T23:02:24Z","title":"LoRA-X: Bridging Foundation Models with Training-Free Cross-Model Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16559","snapshot_observed_at":"2026-08-03T18:56:59.730522Z","title":"Lora-x: Bridging foundation models with training-free cross-model adaptation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.730522Z"},"links":{"cited_paper":"/paper/2501.16559","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:5c93b6ddd478ce3db8584f0967bf2f533b4d100ecdea647cb5b9b412d8e40a2c","observation_id":"e5d4ff49-69e9-4013-8ed0-ed941efdbf52","resolution":{"observed_at":"2026-08-03T18:56:59.730522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:56:59.816556Z","title":"Mindvl: Towards efficient and effective training of multimodal large language models on ascend npus","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.816556Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:cc78c824dd169406746f8f1ab8fc2fe8119279e03dc00a398c1202e24784274f","observation_id":"63fa62b0-2155-4afb-b4d4-6de5a50a2b0d","resolution":{"observed_at":"2026-08-03T18:56:59.816556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-08-09T11:10:24.301223Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-03T18:56:59.896367Z","title":"Minicpm-v 4.5: Cooking efficient mllms via architecture, data, and training recipe.arXiv preprint arXiv:2509.18154, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.896367Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:720c84f9bddd86f9f22f3990afd9366ead508f424768831b409218b523c26e8f","observation_id":"7790ff93-fc9e-4459-8db3-25faa25b988e","resolution":{"observed_at":"2026-08-03T18:56:59.896367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-08-21T07:48:51.700518Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-03T18:57:00.023571Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.023571Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:d67c485a85c604420de6d858aad8b3585e97f3a6f026d29fe56c7123620109d3","observation_id":"ebab57cc-375c-462e-8a20-ca90b0af6cfe","resolution":{"observed_at":"2026-08-03T18:57:00.023571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:00.098640Z","title":"An enhanced hybrid mobilenet","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.098640Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:fd31acc4e404e0c1d3d9073870a10db7faafd026305d6a45960dcbfc8140411c","observation_id":"008bf58b-aa9f-4d63-b6b3-afe0de5eff6e","resolution":{"observed_at":"2026-08-03T18:57:00.098640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:00.168195Z","title":"Thin mobilenet: An enhanced mobilenet architecture","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.168195Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:24fc6b2ada683410b63fe99a0b01abbf7c8474a86bc0ef2a9f7c25183cdec92f","observation_id":"dd1cf042-347c-42ba-858f-3759d68ccec1","resolution":{"observed_at":"2026-08-03T18:57:00.168195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:00.269254Z","title":"Fd-mobilenet: Improved mobilenet with a fast downsampling strategy","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.269254Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:8ac66f036aa464ea824a04c2d7105e24eeec665aa4b626c5d00a5d493ba3e2ce","observation_id":"1b7a7a2f-c8c6-4bf0-98ce-90acc1a1b11e","resolution":{"observed_at":"2026-08-03T18:57:00.269254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:00.342046Z","title":"Efficient mobilenet architecture as image recognition on mobile and embedded devices.Indonesian Journal of Electrical Engineering and Computer Science, 16(1):389–394, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.342046Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:5646e6ac06ab00a50062ea760e005e4badc489b6692aa155374023050efb549f","observation_id":"a81d5007-9dd2-4935-9d35-f9d452a5592b","resolution":{"observed_at":"2026-08-03T18:57:00.342046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-03T18:57:00.416763Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.416763Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:da3253740a6a914d3bdee40a4183c8318979ee0f3a98c998d8acf045acd9fe08","observation_id":"78989075-22d8-400e-9b21-157e88d81613","resolution":{"observed_at":"2026-08-03T18:57:00.416763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-03T18:57:00.517405Z","title":"Paligemma 2: A family of versatile vlms for transfer.arXiv preprint arXiv:2412.03555, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.517405Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:c31769e4959d074f4e59e5ec68aece765d3986f1e00e1004c626563ef0b0be48","observation_id":"47ed50b3-1551-463d-8fc0-b22dcec8868c","resolution":{"observed_at":"2026-08-03T18:57:00.517405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-03T18:57:00.589191Z","title":"Efficiently modeling long sequences with structured state spaces.arXiv preprint arXiv:2111.00396, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.589191Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:16056c827c54cc5645bdd832216bd555e913439a8a1ad0a6e5430876f3dbc8d3","observation_id":"c48870d2-7544-4ea4-bf63-4824afba5456","resolution":{"observed_at":"2026-08-03T18:57:00.589191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:00.660924Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.660924Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:0a5e5af2a2de12849de1024333e482912393265a6c060fae650f57f2791c5955","observation_id":"6cf6510e-9b2b-4414-90dd-c398dc03c7ea","resolution":{"observed_at":"2026-08-03T18:57:00.660924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-03T18:57:00.734153Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.734153Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:ab5a97e1ee735fd7e101daa6da0d197323f3382f5dd982ba345ca75235273f4f","observation_id":"aa5338cd-fa44-42b1-8639-9f7c5d18858a","resolution":{"observed_at":"2026-08-03T18:57:00.734153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:00.805245Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers.Advances in neural information processing systems, 34:572–585, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.805245Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:e4a78c801f7bf7504a23cdbf0810afead2cd697554aca5d07212fa37356dc79a","observation_id":"a1a007b2-7aa4-4dc6-891e-7630ce474161","resolution":{"observed_at":"2026-08-03T18:57:00.805245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-19T20:11:01.764633Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-03T18:57:00.890684Z","title":"Liquid: Language models are scalable and unified multi-modal generators.arXiv preprint arXiv:2412.04332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.890684Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:6ee7b7af00f66ba7bce0214bc26c270f52fe5560c67cfecc5dce350efcf9b018","observation_id":"b540e1e8-a5c9-400e-a37f-a14975165cb7","resolution":{"observed_at":"2026-08-03T18:57:00.890684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07279","last_updated":"2024-07-10T00:01:56Z","snapshot_observed_at":"2026-08-16T13:35:36.685688Z","submitted_at":"2024-07-10T00:01:56Z","title":"Towards a theory of learning dynamics in deep state space models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07279","snapshot_observed_at":"2026-08-03T18:57:00.986982Z","title":"Towards a theory of learning dynamics in deep state space models.arXiv preprint arXiv:2407.07279, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:00.986982Z"},"links":{"cited_paper":"/paper/2407.07279","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:fb6a988eead49684ae576d92b4a1db6382f974ff6a3ff674dfcdedbd925781f8","observation_id":"a231f0db-76d4-4f2d-a1b5-f1eba368e3b7","resolution":{"observed_at":"2026-08-03T18:57:00.986982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17844","last_updated":"2024-08-19T17:26:18Z","snapshot_observed_at":"2026-08-17T14:38:28.563559Z","submitted_at":"2024-03-26T16:33:12Z","title":"Mechanistic Design and Scaling of Hybrid Architectures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17844","snapshot_observed_at":"2026-08-03T18:57:01.034847Z","title":"Mechanistic design and scaling of hybrid architectures, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:01.034847Z"},"links":{"cited_paper":"/paper/2403.17844","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:e13922d95ac7479762d6eadd55dde49ca3241ef7c3e3efb6244baf9025200ec9","observation_id":"cac9283b-b3a5-4e0a-9411-0f24fcb3eceb","resolution":{"observed_at":"2026-08-03T18:57:01.034847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:01.110311Z","title":"Gemma 3n","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:01.110311Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:ff5f2558614b95401bc409f0ef409bb601cec0e1be5dfb50c2794eeccd176841","observation_id":"d311223f-6cfd-4ff3-89fd-3f75314dd85d","resolution":{"observed_at":"2026-08-03T18:57:01.110311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-03T18:57:01.182659Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:01.182659Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:4af58a5abac9c7779c946886463377a6b45208d7c952b53e8564f123e6f6ead4","observation_id":"0768fe1d-6cd5-46bf-8e7d-cfc5bb47a331","resolution":{"observed_at":"2026-08-03T18:57:01.182659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:01.255206Z","title":"Pilot attitudes toward ai in the cockpit: implications for design","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:01.255206Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:a241d4c8da9f305f230c2ea93ef4623110687f9acda9a021dc09a89df96445ee","observation_id":"a80b0535-469d-4189-8529-667e368d5008","resolution":{"observed_at":"2026-08-03T18:57:01.255206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:57:01.339379Z","title":"Intelligent multimodal human- machine collaboration system for safety and security in the cockpit","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:01.339379Z"},"links":{"citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:15d8629d81dbe7f514801df71105b5604bdde9a0f9312626225933cb9c771407","observation_id":"8e42b685-9dc4-43fd-a610-007318431213","resolution":{"observed_at":"2026-08-03T18:57:01.339379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-08-18T09:10:03.802508Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-03T18:57:01.402053Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:01.402053Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:767625a78e7b338ea21825eaf3501c86133e75e97383028c85845ca7e1387289","observation_id":"26c0b9b7-d9d2-4ae6-ac04-737f0737d4fe","resolution":{"observed_at":"2026-08-03T18:57:01.402053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T18:57:01.474744Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:57:01.474744Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:219c27c81827587a75cedd34096c8c0bed81e7d5965f9107fd64d9a78222db31","observation_id":"205fea20-c3da-446a-a2f7-240801743957","resolution":{"observed_at":"2026-08-03T18:57:01.474744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11459","last_updated":"2026-07-20T02:21:16Z","snapshot_observed_at":"2026-08-16T14:00:05.321204Z","submitted_at":"2024-04-17T15:07:06Z","title":"Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11459","snapshot_observed_at":"2026-08-03T18:56:58.340919Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:58.340919Z"},"links":{"cited_paper":"/paper/2404.11459","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:37fc06e8abadb900796863ca985506139fdbb4c6b774d66ddb7d5f02f3049b36","observation_id":"4fe77338-d475-4221-9eca-8114986dde4a","resolution":{"observed_at":"2026-08-03T18:56:58.340919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T23:45:02.772948Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 14 inbound Pith citation observations for arXiv:2512.02924."}