{"as_of":"2026-08-04T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdc17650ecb3b3394fcd855aa01ae81a3d297bbe6ef06a1f96afb7965b3e175b","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T22:22:27.455361Z","state":"measured"},{"denominator":158,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":158,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":147,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:04:10.561277Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:37:34.431677Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:038642e1a2f9a472ee5d8b9ec9a4e558647ee73e3b1ab6c7ee83459211109fa5","observation_id":"fc50935c-2548-474b-8451-a7780fbbe5d4","resolution":{"observed_at":"2026-05-17T20:33:26.932026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:5209bbc008411af67485e9b22dddacbcf1d3be9c4f697b1250d19bd40eb152eb","observation_id":"57ae7c8d-8655-45fb-b70d-4d79c383c401","resolution":{"observed_at":"2026-05-22T20:45:08.095879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:3e3b3bbc44b93b511a8f4ec9cdc9ac69794de2bcc421e1e6c072449a9f88b5de","observation_id":"8f2789c6-f92e-41f1-aa8e-49bd94c96e37","resolution":{"observed_at":"2026-05-15T03:42:45.329287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2507.21166","last_updated":"2026-06-22T12:55:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-25T13:05:01Z","title":"The Ratchet Effect in Silico: How Interaction Drives Cumulative Intelligence in Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-19T02:38:27.510872Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.21166"},"observation_digest":"sha256:dcb85d858ebb894ea0ce4eed303ae7da0a74237798a5d2bebc19abc0029b669d","observation_id":"fb8f2733-32a7-48cb-b36a-42a92b07b0c8","resolution":{"observed_at":"2026-05-19T02:41:59.995046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T21:28:41.904725Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2508.05635"},"observation_digest":"sha256:26f4ac7c7040fea56e8ea9d5546934b71fbfeba663abb374e04bf061c84998d1","observation_id":"b41b52fd-ff1e-461b-9ae1-a166d668d306","resolution":{"observed_at":"2026-05-15T21:28:41.934494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2508.10635","last_updated":"2026-04-17T14:19:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-14T13:33:44Z","title":"ChatENV: An Interactive Vision-Language Model for Sensor-Guided Environmental Monitoring and Scenario Simulation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T23:14:58.555068Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2508.10635"},"observation_digest":"sha256:19884ebb5600319ab033922049e6edbfcee2e621b960be119e8db1261200a287","observation_id":"2bade1fd-f17d-41c8-8fcd-d058ffc92a10","resolution":{"observed_at":"2026-05-18T23:16:54.039837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2508.17458","last_updated":"2026-04-20T03:53:49Z","snapshot_observed_at":"2026-07-06T22:17:26.368596Z","submitted_at":"2025-08-24T17:26:58Z","title":"Evaluating the Impact of Verbal Multiword Expressions on Machine Translation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2508.17458"},"observation_digest":"sha256:c66e6838d65f00b7431c59e8696917c4e02a0c121db14dc9b0f855e682058e13","observation_id":"7e801151-e8b9-4e50-b28a-4746425bba15","resolution":{"observed_at":"2026-05-18T20:51:50.257012Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2509.03525","last_updated":"2025-10-07T06:46:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-24T13:15:28Z","title":"Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T21:14:16.601070Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2509.03525"},"observation_digest":"sha256:a091d9bf9d3961016247dd1881864266ddd8b28ffb9a568af0a86346f66049da","observation_id":"70747e53-9514-4468-9a13-549f43fcbc9e","resolution":{"observed_at":"2026-05-18T21:16:51.174160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2509.22123","last_updated":"2026-05-13T12:28:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-26T09:46:13Z","title":"Multilingual Vision-Language Models, A Survey","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-18T13:02:08.000814Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2509.22123"},"observation_digest":"sha256:ca0399ff3fc897b08f25dfc3b7a7ab262aec8a3f3f73910267c4d58ba1327760","observation_id":"349de331-6c6b-4bfa-9182-3db61011571b","resolution":{"observed_at":"2026-05-18T13:02:37.479387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2509.24478","last_updated":"2026-04-18T09:59:46Z","snapshot_observed_at":"2026-07-06T22:31:05.409865Z","submitted_at":"2025-09-29T08:53:02Z","title":"A Text-To-Text Alignment Algorithm for Better Evaluation of Modern Speech Recognition Systems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T13:12:34.387094Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2509.24478"},"observation_digest":"sha256:c5af4b69f797bb71ba1781a062de748cefbe04203e74b413f5f55944b82144e0","observation_id":"f15fc938-5188-44a6-9259-c8a8a484dae1","resolution":{"observed_at":"2026-05-18T13:12:37.223016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2510.00626","last_updated":"2026-04-26T15:50:39Z","snapshot_observed_at":"2026-07-06T22:31:20.110402Z","submitted_at":"2025-10-01T07:59:45Z","title":"When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T11:08:08.916893Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2510.00626"},"observation_digest":"sha256:88c2826294fec83400f0ece2e9cd028dd8ae56f6ee89516ec7a5d8d32702ad4c","observation_id":"c85b32d0-1da5-40b8-8a98-3b3ab4235798","resolution":{"observed_at":"2026-05-18T11:11:17.911796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-03T22:04:10.561277Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12576","last_updated":"2026-06-11T15:50:40Z","snapshot_observed_at":"2026-08-03T22:04:08.927300Z","submitted_at":"2025-11-16T12:38:28Z","title":"Can Small GenAI Language Models Rival Large Language Models in Understanding Application Behavior?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T22:04:10.561277Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2511.12576"},"observation_digest":"sha256:e050ec8f1d80b8d1d94c16ea51a05fea6de2c660b443fcaf22ce4b8028926897","observation_id":"2245ba5c-9be9-4832-983d-fcde7624f0d8","resolution":{"observed_at":"2026-08-03T22:04:10.561277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2511.18359","last_updated":"2026-04-07T10:36:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-23T09:12:48Z","title":"TRANSPORTER: Transferring Visual Semantics from VLM Manifolds","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T05:59:14.478279Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2511.18359"},"observation_digest":"sha256:86d7b4977b03037002aa741b7a51f7c691a7ba61a0a279f04ac8d6cb7b5f4499","observation_id":"40843380-1b75-42f8-ac3d-a1620e9a27e9","resolution":{"observed_at":"2026-05-17T06:01:34.678805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-03T20:41:48.653117Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras.CoRR, abs/2503.01743, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19032","last_updated":"2026-07-09T04:07:40Z","snapshot_observed_at":"2026-08-03T20:41:47.305603Z","submitted_at":"2025-11-24T12:07:56Z","title":"Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:41:48.653117Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2511.19032"},"observation_digest":"sha256:0cfa2b0e006bf4a4d201dc1b81a6db0cdd0e0ff486142596f76d0178f999fa94","observation_id":"c1cf2137-0847-4b67-9c2c-0c74ebe91a48","resolution":{"observed_at":"2026-08-03T20:41:48.653117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2512.03676","last_updated":"2026-04-11T01:39:04Z","snapshot_observed_at":"2026-07-06T22:37:41.555068Z","submitted_at":"2025-12-03T11:07:50Z","title":"Different types of syntactic agreement recruit the same units within large language models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T02:43:51.273343Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2512.03676"},"observation_digest":"sha256:6abe803c3732efd43d4933b793ac30b0fd8eae56db958f50eda6b0e822ed15df","observation_id":"89fc915a-8bc4-4449-96ce-5056f5e7d23f","resolution":{"observed_at":"2026-05-17T02:43:53.235603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2512.16378","last_updated":"2026-04-25T20:42:51Z","snapshot_observed_at":"2026-08-02T18:57:30.783881Z","submitted_at":"2025-12-18T10:21:14Z","title":"Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-16T21:49:21.785096Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2512.16378"},"observation_digest":"sha256:712c1a35107c881f06d6afa8ee4916fe0dfb9e0f192c3bd21d77d50d64e9e712","observation_id":"1aa76f50-759a-4e00-9a4a-da4a95f0bf81","resolution":{"observed_at":"2026-05-16T21:51:17.818489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-03T12:01:58.870711Z","title":"Phi-4-mini tech- nical report: Compact yet powerful multimodal lan- guage models via mixture-of-loras","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-03T12:01:57.439695Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:01:58.870711Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:d2fbdd54e1df105aeb9cb644f297f40080e53c05f56efe5400784e481bc7de8e","observation_id":"24ff696b-f949-4fcc-a3e9-5f6a45c96737","resolution":{"observed_at":"2026-08-03T12:01:58.870711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2601.09270","last_updated":"2026-04-13T14:09:14Z","snapshot_observed_at":"2026-07-31T23:52:34.110469Z","submitted_at":"2026-01-14T08:05:16Z","title":"MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T14:30:46.664861Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2601.09270"},"observation_digest":"sha256:13391e40338abaac9cc248d71305541c55565d09ca45366c1f171f5072725f3a","observation_id":"1146e15d-c8ba-4895-9d60-a9253b2fd06c","resolution":{"observed_at":"2026-05-16T14:31:01.952272Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2601.12248","last_updated":"2026-05-10T16:47:20Z","snapshot_observed_at":"2026-07-06T22:42:03.665045Z","submitted_at":"2026-01-18T03:55:28Z","title":"AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T14:04:17.935630Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2601.12248"},"observation_digest":"sha256:bb2f8ce88608fdc91b21ece550fc7b79392ee9c22408b7f1ea40e1513eaca127","observation_id":"06a6f66f-5af8-4c96-affb-752da934bb85","resolution":{"observed_at":"2026-05-16T14:07:58.668659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2601.16199","last_updated":"2026-04-30T16:16:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-22T18:51:13Z","title":"PAL*M: Property Attestation for Large Generative Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:55.160572Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2601.16199"},"observation_digest":"sha256:1cd413414d81bdc07161519be5a0f74d8a08b53ffef4c1d41345eabc36d23f65","observation_id":"89b64e93-047f-42b4-9867-1c9ea27f28e7","resolution":{"observed_at":"2026-05-16T11:37:48.703148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-02T22:50:43.132868Z","title":"In Proceedings of the 31st International Conference on Computational Linguistics, pages 8057–8087, Abu Dhabi, UAE","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15778","last_updated":"2026-05-29T10:09:56Z","snapshot_observed_at":"2026-08-02T22:50:41.213256Z","submitted_at":"2026-02-17T18:10:00Z","title":"*-PLUIE: Personalisable metric with Llm Used for Improved Evaluation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T22:50:43.132868Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2602.15778"},"observation_digest":"sha256:6c1700899cc0c8144647a2f70bd3ed3665145ebe473c7c40462f0b92054c0fbc","observation_id":"d11f1a18-6b2f-40d1-8637-a8799e30cd2e","resolution":{"observed_at":"2026-08-02T22:50:43.132868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2603.01059","last_updated":"2026-04-09T00:42:09Z","snapshot_observed_at":"2026-08-02T10:05:40.434546Z","submitted_at":"2026-03-01T11:29:25Z","title":"GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T18:27:16.527361Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2603.01059"},"observation_digest":"sha256:4dee653d2ab99913a9944014d8fb3c103ab7a3710006646050f67e222ed3eee8","observation_id":"0d04c0e6-31a9-4951-9d8e-717538f328cf","resolution":{"observed_at":"2026-05-15T18:30:14.474460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-15T13:58:09.323985Z","title":"Phi-4- mini technical report: Compact yet powerful multimodal language models via mixture-of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06193","last_updated":"2026-06-22T08:34:44Z","snapshot_observed_at":"2026-07-15T13:58:09.128155Z","submitted_at":"2026-03-06T12:04:12Z","title":"Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T13:58:09.323985Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2603.06193"},"observation_digest":"sha256:13ca1dc459ede8da08ea42da91f56d813e908e2008a65f49b73407899f3a19b0","observation_id":"3222f388-5a43-4662-9b73-556720b5c28e","resolution":{"observed_at":"2026-07-15T13:58:09.323985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2603.15045","last_updated":"2026-07-07T07:07:08Z","snapshot_observed_at":"2026-08-01T21:49:24.005109Z","submitted_at":"2026-03-16T09:57:06Z","title":"LLMs and Speech: Integration vs. Combination","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:22.138517Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2603.15045"},"observation_digest":"sha256:50f7cf3abb87553f1fe1649242b7a5a8edd2773fa71f7a5266e33eab491b87d2","observation_id":"0cb3c854-847d-4ea5-ae15-6bedb7ad260b","resolution":{"observed_at":"2026-05-15T10:45:28.322239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-14T20:46:17.286576Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15045","last_updated":"2026-07-07T07:07:08Z","snapshot_observed_at":"2026-08-01T21:49:24.005109Z","submitted_at":"2026-03-16T09:57:06Z","title":"LLMs and Speech: Integration vs. Combination","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T20:46:17.286576Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2603.15045"},"observation_digest":"sha256:5dda721570a390daec3e3e87438b1d47d50826c647be7318e85d911a6245484b","observation_id":"3aff7a7e-66cf-4c83-a733-f6787ccb92ca","resolution":{"observed_at":"2026-07-14T20:46:17.286576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2603.25412","last_updated":"2026-05-06T06:58:11Z","snapshot_observed_at":"2026-07-06T22:50:37.468743Z","submitted_at":"2026-03-26T13:08:56Z","title":"Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T00:45:43.705160Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2603.25412"},"observation_digest":"sha256:ed78564ba4763cdaeabdc82a25981fb7a6f31f83bd32f60009750c3376999d97","observation_id":"e288d52e-4ea1-4669-98eb-4a89e9b48209","resolution":{"observed_at":"2026-05-15T00:48:24.987287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.07740","last_updated":"2026-04-09T02:55:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T02:55:51Z","title":"Beyond Pedestrians: Caption-Guided CLIP Framework for High-Difficulty Video-based Person Re-Identification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:33:51.519897Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.07740"},"observation_digest":"sha256:1dead49bcf64d30a998417f5fc2fac710a345b0dc48ef4fcfa38c90e3c0aad5c","observation_id":"36ab39a9-6ffc-4be1-a908-eb17e0495041","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.07895","last_updated":"2026-04-09T07:06:26Z","snapshot_observed_at":"2026-08-02T09:27:58.517939Z","submitted_at":"2026-04-09T07:06:26Z","title":"DialBGM: A Benchmark for Background Music Recommendation from Everyday Multi-Turn Dialogues","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:08:18.876839Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.07895"},"observation_digest":"sha256:c37323b3d54ff70e5738b9ced1724eb96ba297b7cdeedcd8a94ab356e0455056","observation_id":"57aa726b-99ee-441b-b6c7-ebeae55e506c","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.08896","last_updated":"2026-04-10T02:59:38Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T02:59:38Z","title":"GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:56:12.097628Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.08896"},"observation_digest":"sha256:fa846f18edb3a6cb95a0359d7db950772dbbe7ddda218734b2808afebcded985","observation_id":"4b361755-3521-4b04-90b6-f311654cb79a","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.10014","last_updated":"2026-04-11T03:58:02Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:02Z","title":"Demographic and Linguistic Bias Evaluation in Omnimodal Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:01.819578Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.10014"},"observation_digest":"sha256:dde4a8d7dcd70756257aafa95362d9e8b48343e0b64e2c2e1846f7aad407b69d","observation_id":"5e717bab-89e8-4e41-9a2c-19ca42fb60ca","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.10733","last_updated":"2026-04-12T17:12:55Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T17:12:55Z","title":"Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T16:05:09.033412Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.10733"},"observation_digest":"sha256:c202968146a4f7e64559beaa85b39ea518e3789d294f29e15ef117591cb0d4c5","observation_id":"c87e02ee-03cf-49ae-9398-94046dc3f5d3","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.10825","last_updated":"2026-05-15T23:36:17Z","snapshot_observed_at":"2026-07-06T22:59:23.126963Z","submitted_at":"2026-04-12T21:37:26Z","title":"CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:21:48.653698Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.10825"},"observation_digest":"sha256:ca54b72d9d78a47c1b2c33918a727db1526ebf44873011366a8e6177c14c9b1e","observation_id":"2872c852-abe0-4d71-808a-0a2b2931e3ac","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.10825","last_updated":"2026-05-15T23:36:17Z","snapshot_observed_at":"2026-07-06T22:59:23.126963Z","submitted_at":"2026-04-12T21:37:26Z","title":"CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T00:54:55.296944Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.10825"},"observation_digest":"sha256:fa47a1fb52fbc736caf22d6406f53a19f10d1c44a4f010f9f0ac5b357e26e9b2","observation_id":"5c181fb5-36d4-4875-a844-2cb19b3469e8","resolution":{"observed_at":"2026-05-21T00:59:19.369998Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.12398","last_updated":"2026-04-14T07:33:44Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:33:44Z","title":"Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T14:35:20.515352Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.12398"},"observation_digest":"sha256:79781807f8710c15768a32032e45a0b2d377524a392fbead8a77d994b008bf58","observation_id":"95db6952-3fa9-4d1a-bbe3-9fd43d583bf3","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.13073","last_updated":"2026-03-20T17:25:00Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-03-20T17:25:00Z","title":"OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T08:06:45.477344Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.13073"},"observation_digest":"sha256:e38daac8ad13b5a6fd721f1c5efb81a09e4c4b1cad377c8441d9e5b771700368","observation_id":"a1d92992-a423-4fc9-b6c0-899a0b3f3905","resolution":{"observed_at":"2026-05-15T08:09:51.365573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"Phi-4-mini technical report: Compact yet powerful mul- timodal language models via mixture-of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:b434e0ec70ec6f3bc86af6a304c7fb494eaef909cbfd1796e920193a3fe6fdfb","observation_id":"4f47e51d-fc89-4997-9516-e857365c2277","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-01T20:57:25.785838Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:89aaa16bc7e70d9485654a6facd04b912206a4e08a2e8656399e21ab1d51a486","observation_id":"284115d3-ad83-4938-b6fc-a30a5dd9bd2f","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.15602","last_updated":"2026-04-17T00:56:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-17T00:56:59Z","title":"GroupDPO: Memory efficient Group-wise Direct Preference Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T09:43:18.432084Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.15602"},"observation_digest":"sha256:edc8b1a8a65aa6f039891374f1b263a1abe37fbae65cecc998db78604af0246c","observation_id":"5c3933bd-3a26-4a96-87c3-1f7770dfa598","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.15929","last_updated":"2026-05-18T12:22:43Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:39:01Z","title":"MUSCAT: MUltilingual, SCientific ConversATion Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:22.200577Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.15929"},"observation_digest":"sha256:88ad891a2863b022fea01db99e729adb12c1750f4bbe68866c1d1c0608542703","observation_id":"69d20138-12fc-4bc3-896f-7d12f047b861","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.15929","last_updated":"2026-05-18T12:22:43Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:39:01Z","title":"MUSCAT: MUltilingual, SCientific ConversATion Benchmark","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T00:45:01.115573Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.15929"},"observation_digest":"sha256:3630c1fd3b3781724eead31cc43930ebd44949fdd5c40611b96cd46941fb33e4","observation_id":"c971776e-6541-4b9c-a51e-166e3f6bb18f","resolution":{"observed_at":"2026-05-21T00:49:19.556887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.17248","last_updated":"2026-07-03T19:14:23Z","snapshot_observed_at":"2026-07-12T19:05:07.029596Z","submitted_at":"2026-04-19T04:22:47Z","title":"VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:50.923340Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.17248"},"observation_digest":"sha256:41e2a7f98a7117e192a46b27b063987f1356c8269e2d6d2b84a60a5197a37e35","observation_id":"043d299a-f7f1-4bdd-bbd3-fe76ecae512c","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.17472","last_updated":"2026-04-19T14:53:38Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T14:53:38Z","title":"UniMesh: Unifying 3D Mesh Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:42.679323Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.17472"},"observation_digest":"sha256:705ffafe390d39df591249f138640521814c6a9eb991185ec1fdda656551f5d0","observation_id":"67445640-9fcd-43a2-a00b-1e415eb7a2aa","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.19300","last_updated":"2026-04-21T10:05:28Z","snapshot_observed_at":"2026-08-03T21:49:52.344628Z","submitted_at":"2026-04-21T10:05:28Z","title":"HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T01:34:54.375266Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.19300"},"observation_digest":"sha256:59903a50bc7a4b20de1bb121315827cd5839580b19bf3bf895ad0afecd8ff46d","observation_id":"73f61951-d7e7-4640-9e0c-e49ef425e73e","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.20720","last_updated":"2026-04-22T16:07:10Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:07:10Z","title":"COMPASS: COntinual Multilingual PEFT with Adaptive Semantic Sampling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T01:14:16.831333Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.20720"},"observation_digest":"sha256:a93fe78eb6c8e6054794054dc475da13dbc54077e29d7466a121b804168994eb","observation_id":"16bd3282-88d4-47ec-8ff1-283c90a56f76","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.21766","last_updated":"2026-04-23T15:22:36Z","snapshot_observed_at":"2026-08-02T10:23:57.097423Z","submitted_at":"2026-04-23T15:22:36Z","title":"AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T22:11:27.005071Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.21766"},"observation_digest":"sha256:61c63fb5746dd56459d3fc499eb774a488844b594a58ddb74f211dae70cb3d97","observation_id":"034b8f9e-1d1c-4f36-98cf-c08814fee02b","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.21905","last_updated":"2026-04-23T17:50:23Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:50:23Z","title":"Low-Rank Adaptation Redux for Large Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T21:48:48.992712Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.21905"},"observation_digest":"sha256:11c33788a882ef738cbd87586c7e2c491fe5644a6e44d6ff33e8c6c354e7dc1d","observation_id":"0b32c577-78b7-47c1-bb5d-5e9f967ab1af","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.23717","last_updated":"2026-04-26T14:00:31Z","snapshot_observed_at":"2026-08-02T21:00:22.453264Z","submitted_at":"2026-04-26T14:00:31Z","title":"HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T05:20:30.823304Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.23717"},"observation_digest":"sha256:21fe9a47f4457d52d28f0f67bee3416b2eb2df2d837a97d663410e9fbe4deb37","observation_id":"e9899b37-44e8-40af-bc00-b577a5b281de","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:60da6ee0a11eeff1cb54f8e0e5e0c42a8098f02be52a7023414f6a29c454bc90","observation_id":"71fa4ab1-7c5b-43dd-ba03-0aea4193ab5e","resolution":{"observed_at":"2026-05-11T23:16:36.277354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:597a14511af0b8124a4fc3a462f915901b5363b377df78a0fcf3d514fe5e5356","observation_id":"b8f59b96-2c41-4705-9995-ca30cc122839","resolution":{"observed_at":"2026-05-12T00:41:26.438714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.26568","last_updated":"2026-04-29T11:52:54Z","snapshot_observed_at":"2026-07-06T23:12:10.599132Z","submitted_at":"2026-04-29T11:52:54Z","title":"Multimodal LLMs are not all you need for Pediatric Speech Language Pathology","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T11:46:28.742487Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.26568"},"observation_digest":"sha256:2dc8f408b5a9b2d74b4fd5d6309fb24f24e7abd75c46c22f4720310fc3323975","observation_id":"62893fbb-299f-4133-8436-3b242fc3ee0d","resolution":{"observed_at":"2026-05-12T09:16:26.388012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.26959","last_updated":"2026-04-07T10:54:57Z","snapshot_observed_at":"2026-07-06T23:12:29.385105Z","submitted_at":"2026-04-07T10:54:57Z","title":"CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:17:27.351727Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.26959"},"observation_digest":"sha256:cc980a1f29f985ae19a61cf64e55f8eef2f43c71975055fbb506702c00afeca8","observation_id":"70cbbf45-b33a-48ff-ab37-7c7b7e72927b","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2604.27543","last_updated":"2026-04-30T07:48:27Z","snapshot_observed_at":"2026-08-04T03:33:27.029531Z","submitted_at":"2026-04-30T07:48:27Z","title":"AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T09:12:14.094145Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2604.27543"},"observation_digest":"sha256:f85571bda49134db67daed376724108db9f9663b49d3554d15a86fdf41d0d611","observation_id":"1b7778fc-fc47-4cba-b6ba-f68cfb58fc82","resolution":{"observed_at":"2026-05-12T09:46:27.897018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.00668","last_updated":"2026-05-01T13:50:28Z","snapshot_observed_at":"2026-07-31T09:23:01.105203Z","submitted_at":"2026-05-01T13:50:28Z","title":"SENECA: Small-Sample Discrete Entropy Estimation via Self-Consistent Missing Mass","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T18:57:31.542345Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.00668"},"observation_digest":"sha256:119c39af4bb547da9c799913c82468b94e9ec76609c8bd05d75fc83bfb15f3bb","observation_id":"56adbc4e-cbc1-46e7-942b-24a93f79c35d","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.01163","last_updated":"2026-05-01T23:45:36Z","snapshot_observed_at":"2026-07-06T23:14:24.758147Z","submitted_at":"2026-05-01T23:45:36Z","title":"Multimodal Data Curation Through Ranked Retrieval","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-09T17:59:49.890800Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.01163"},"observation_digest":"sha256:6396567d96c38186cdb41e567cd03819701df4a5534529c79ea57a6bd4179460","observation_id":"42d1680b-dfeb-4d33-8036-6f100a545789","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.06234","last_updated":"2026-06-09T07:34:06Z","snapshot_observed_at":"2026-08-03T21:25:53.409207Z","submitted_at":"2026-05-07T13:22:26Z","title":"RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T09:12:00.835585Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.06234"},"observation_digest":"sha256:d49a9f99c415e64688aeef2b9f8f86c85b5860bb0af41c2cb80f6624f4320732","observation_id":"cc1fed03-1f8c-4942-94bb-f2dd98a4e270","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.06234","last_updated":"2026-06-09T07:34:06Z","snapshot_observed_at":"2026-08-03T21:25:53.409207Z","submitted_at":"2026-05-07T13:22:26Z","title":"RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T23:27:32.526304Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.06234"},"observation_digest":"sha256:a5bbf9705fcf72c5800e876429058922abcf7309c88e78d59c75283fda5b3283","observation_id":"e418c78d-0996-4969-be86-3171c5a958a3","resolution":{"observed_at":"2026-06-30T23:35:07.752240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.06605","last_updated":"2026-07-21T14:46:47Z","snapshot_observed_at":"2026-08-02T14:49:06.584741Z","submitted_at":"2026-05-07T17:25:15Z","title":"How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:13:16.896486Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.06605"},"observation_digest":"sha256:3d8e2d70215d1ce9df55786d3fd6e7ae34dbe8b6da3646847c2124529c00fca0","observation_id":"8f7f689e-fdfc-4527-b622-50b66d9dfb90","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-02T14:49:12.100964Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.06605","last_updated":"2026-07-21T14:46:47Z","snapshot_observed_at":"2026-08-02T14:49:06.584741Z","submitted_at":"2026-05-07T17:25:15Z","title":"How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:49:12.100964Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.06605"},"observation_digest":"sha256:0f7cda9934aef1742ce0f21b255201adba94c19a195b4e7fdf8d52286f74a372","observation_id":"b1fcc56e-8a75-4b8c-86d3-6acf933db2e5","resolution":{"observed_at":"2026-08-02T14:49:12.100964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.06747","last_updated":"2026-05-07T15:21:58Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T15:21:58Z","title":"HumanNet: Scaling Human-centric Video Learning to One Million Hours","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T00:51:08.414394Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.06747"},"observation_digest":"sha256:b4da9cd0938d5d3c3f5b1a3f27a45ab18006a8003ac365384b5ceadfab2da61e","observation_id":"f1665edc-74f6-42f9-be50-114b16f0cb87","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:d40777b103f90501ea84f42961e85d013bc29e8fb3c0a2f10591fab04d00c256","observation_id":"47553457-1369-49ca-bb38-923fa5a77944","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.07711","last_updated":"2026-05-21T08:28:27Z","snapshot_observed_at":"2026-07-30T13:45:02.553757Z","submitted_at":"2026-05-08T13:16:17Z","title":"SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T03:01:13.168529Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.07711"},"observation_digest":"sha256:205dc66ce9cba46fc96aeec59afe24ec99e22bee5ac73afa8cf0918ba9fdb3e6","observation_id":"9affb265-1f43-4a13-9fa8-3e5d2889b799","resolution":{"observed_at":"2026-05-11T22:22:28.302846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.07711","last_updated":"2026-05-21T08:28:27Z","snapshot_observed_at":"2026-07-30T13:45:02.553757Z","submitted_at":"2026-05-08T13:16:17Z","title":"SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T10:30:11.309910Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.07711"},"observation_digest":"sha256:c09f8d28cd004273f5bf93a4343b66e12d6cc6e4255c732bff92ccbfb1e0e91b","observation_id":"18d09668-4518-4b80-b812-32da377dc361","resolution":{"observed_at":"2026-05-22T10:31:24.938742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.09594","last_updated":"2026-05-10T15:13:38Z","snapshot_observed_at":"2026-08-02T22:52:59.046448Z","submitted_at":"2026-05-10T15:13:38Z","title":"Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T03:49:49.484361Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.09594"},"observation_digest":"sha256:ca4b98ce11723a8dd618d57847463b82d88eab9a59f0435feccca319eb93e98c","observation_id":"08c5d7b5-7783-402c-9bdf-aa30407e24c6","resolution":{"observed_at":"2026-05-12T06:56:27.312250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.09996","last_updated":"2026-05-11T05:11:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T05:11:22Z","title":"Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:23.060562Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.09996"},"observation_digest":"sha256:dd65edfadea3622cbcd4f4fe9007e95bd98b80fa32f240fd95a542b6d426ac43","observation_id":"9277b1a2-b629-4636-8892-4324cd353a98","resolution":{"observed_at":"2026-05-12T06:46:24.427716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.10576","last_updated":"2026-05-11T13:48:57Z","snapshot_observed_at":"2026-08-03T17:44:06.655773Z","submitted_at":"2026-05-11T13:48:57Z","title":"SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:50.940530Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.10576"},"observation_digest":"sha256:a596c542c508d0709a879bdf31056a04d08ec9b945b39cfd230867c4dd92aebf","observation_id":"ddec2916-69e0-4a60-b4c6-831bf7949106","resolution":{"observed_at":"2026-05-12T06:46:35.186477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.10850","last_updated":"2026-05-11T17:00:00Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:00:00Z","title":"Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:48:09.071812Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.10850"},"observation_digest":"sha256:f9faff828417ba781cb3eebac1672e455eeeb3818e7b0010e051b2dd1141bed0","observation_id":"25368d89-2efe-4311-bef9-dd183ae8ab52","resolution":{"observed_at":"2026-05-12T05:56:25.303513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.12522","last_updated":"2026-04-04T17:30:35Z","snapshot_observed_at":"2026-08-02T09:51:20.420159Z","submitted_at":"2026-04-04T17:30:35Z","title":"Differences in Text Generated by Diffusion and Autoregressive Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:59:06.804446Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.12522"},"observation_digest":"sha256:e131934a39ad79daec965f2c62c0d71468865ef2d7e8fb152b470aaa5697d105","observation_id":"5051896e-5e5a-4762-913b-cebfd0e56904","resolution":{"observed_at":"2026-05-14T20:59:27.192307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.12530","last_updated":"2026-04-21T18:38:50Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-04-21T18:38:50Z","title":"In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:14.913156Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.12530"},"observation_digest":"sha256:ba42c2c39dc305f971adf32a8b50a51267814719191b282cb2d11087add58d85","observation_id":"176a8cba-f680-4354-bdec-bec0e0afdd25","resolution":{"observed_at":"2026-05-14T21:32:59.289781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.14906","last_updated":"2026-05-14T14:41:17Z","snapshot_observed_at":"2026-08-02T09:41:14.453439Z","submitted_at":"2026-05-14T14:41:17Z","title":"MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-30T21:00:25.664841Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.14906"},"observation_digest":"sha256:0a44d1c833efe9f5584eb1b853d5f3ccf17511dc2c3ad8fc5d5127b1b86c5db0","observation_id":"bdeb7108-6c71-4401-9751-87770047b854","resolution":{"observed_at":"2026-06-30T21:05:04.230702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.15104","last_updated":"2026-05-20T10:20:54Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:22:42Z","title":"From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents","version":2},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-21T08:45:56.550821Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.15104"},"observation_digest":"sha256:fea9199f89039a966485ba3775fe8a26c5886bcba74a1094b0ea9952acebce88","observation_id":"3ea3408b-e9f4-46b0-baf5-00a09aafeaaa","resolution":{"observed_at":"2026-05-21T08:49:53.807525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.15172","last_updated":"2026-05-14T17:56:22Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T17:56:22Z","title":"MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T03:04:27.417831Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.15172"},"observation_digest":"sha256:ca6e2403229694508a631eaf8f5bd899912d986f019e06d3991ef900111ced67","observation_id":"f69373fe-0e40-4211-b73e-43ab0adebcae","resolution":{"observed_at":"2026-05-15T03:09:44.605032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.17228","last_updated":"2026-05-17T02:28:25Z","snapshot_observed_at":"2026-07-06T23:28:16.927009Z","submitted_at":"2026-05-17T02:28:25Z","title":"Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-20T14:48:55.203993Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.17228"},"observation_digest":"sha256:1a7384719ad6cdf6f3de8b783da758e31abcb3e48b4ebd472bcceb70e110973d","observation_id":"5f0db0b1-fd7b-4393-b486-ea38e3944eaa","resolution":{"observed_at":"2026-05-20T14:53:23.408415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.17370","last_updated":"2026-05-19T04:10:37Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T10:27:52Z","title":"CBT-Audio: Evaluating Audio Language Models for Patient-Side Distress Intensity Estimation in CBT Session Recordings","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T13:25:09.024054Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.17370"},"observation_digest":"sha256:d3b1fc1892c0780e666a4e9da37513de69f0eb51e09103c7abc1f4541a2ed6ee","observation_id":"21f2d9f6-9b08-4086-8101-fafa1fbd444e","resolution":{"observed_at":"2026-05-20T13:28:19.106437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.17860","last_updated":"2026-05-18T05:10:26Z","snapshot_observed_at":"2026-08-01T20:05:46.229785Z","submitted_at":"2026-05-18T05:10:26Z","title":"PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-20T11:30:33.672467Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.17860"},"observation_digest":"sha256:2641aaae046d5be8e4e77ebc7914545114496ea9e2c7aa42ca113b0fd7615752","observation_id":"1c1bd359-02b1-4eec-8e9a-b2ad6134961f","resolution":{"observed_at":"2026-05-20T11:33:14.431845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.18053","last_updated":"2026-05-18T08:41:34Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:41:34Z","title":"Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T12:13:14.295659Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.18053"},"observation_digest":"sha256:72aed508108752530e53034f4a1574d3b6854e0824d7654e362aaa79fe39d687","observation_id":"a94cb6ff-fe0c-4df3-bc32-128b74fc7656","resolution":{"observed_at":"2026-05-20T12:13:15.941762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.18577","last_updated":"2026-05-18T15:55:22Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:55:22Z","title":"OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:59.215750Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.18577"},"observation_digest":"sha256:280ff3769d30a72640a8b9bebc7f3c6441ca970d863026771d21daae4c76da5d","observation_id":"d8ab7666-9b65-4167-8ba5-c9fefde59fb4","resolution":{"observed_at":"2026-05-20T11:08:13.489000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.20075","last_updated":"2026-05-19T16:28:53Z","snapshot_observed_at":"2026-08-01T16:11:19.969726Z","submitted_at":"2026-05-19T16:28:53Z","title":"CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T05:25:51.655208Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.20075"},"observation_digest":"sha256:13c106fe0db856bd7b8c43873a3966e9cbe7baa11652dd6eb689872ade489d36","observation_id":"5edbd3f2-3b67-4f3f-911c-c560858b7bd7","resolution":{"observed_at":"2026-05-20T05:28:05.007229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.21235","last_updated":"2026-05-20T14:24:11Z","snapshot_observed_at":"2026-08-03T21:38:51.443581Z","submitted_at":"2026-05-20T14:24:11Z","title":"LamPO: A Lambda Style Policy Optimization for Reasoning Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T05:11:35.785227Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.21235"},"observation_digest":"sha256:0737074c8e05f828e1ee5eaf96ee6c1a1974068a0d5fdff297ee5cf6fba77736","observation_id":"ea3e0ebd-899e-4157-9c75-eb8cf43c7b8a","resolution":{"observed_at":"2026-05-21T05:13:58.426891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.21699","last_updated":"2026-05-20T19:59:31Z","snapshot_observed_at":"2026-07-30T08:07:30.836503Z","submitted_at":"2026-05-20T19:59:31Z","title":"X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T10:04:35.334305Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.21699"},"observation_digest":"sha256:9621291765de9ee68899a5101782e513eaaaeaf49e3cc2b113c46b1f9b73f689","observation_id":"428e3860-292e-4a38-9643-6a22984567e0","resolution":{"observed_at":"2026-05-22T10:04:47.067371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.22907","last_updated":"2026-05-21T18:00:22Z","snapshot_observed_at":"2026-08-02T16:30:28.109405Z","submitted_at":"2026-05-21T18:00:22Z","title":"VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:49.390597Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.22907"},"observation_digest":"sha256:a85e7dfd9912ccb4121313d6fbb25d4f33b341d4134ce724737654566e72f3fd","observation_id":"e316f673-279b-4fcc-a9e9-677f72a9f445","resolution":{"observed_at":"2026-05-25T05:55:25.040607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.23975","last_updated":"2026-05-13T16:15:33Z","snapshot_observed_at":"2026-07-30T20:50:18.615024Z","submitted_at":"2026-05-13T16:15:33Z","title":"Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T21:22:15.413485Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.23975"},"observation_digest":"sha256:af2829688db92eab4a0ac087aeff4ee02243c01355fded1c8f645d63faf4ae7f","observation_id":"5ae4628e-1bbc-44a3-bd87-07b61e3dff07","resolution":{"observed_at":"2026-06-30T21:25:04.331128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.25143","last_updated":"2026-05-31T05:24:41Z","snapshot_observed_at":"2026-07-06T23:35:06.733347Z","submitted_at":"2026-05-24T15:48:57Z","title":"Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T11:06:21.527926Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.25143"},"observation_digest":"sha256:7a61f5e7aa61b0800a065ead8b9eb75ab7744e25a43bedbbee51ea068d24658b","observation_id":"b2c422b4-a748-4a71-a388-5dbfedde6161","resolution":{"observed_at":"2026-06-30T11:54:38.723471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.26038","last_updated":"2026-05-25T17:05:52Z","snapshot_observed_at":"2026-08-04T04:22:12.136237Z","submitted_at":"2026-05-25T17:05:52Z","title":"DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:53:52.992152Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.26038"},"observation_digest":"sha256:18fbc667064ec168496d079b8fe30c0c786592d55e66ab856e674b8ca39b4c23","observation_id":"77d12bc1-f31d-4c81-8966-89a4d999cc7f","resolution":{"observed_at":"2026-06-29T22:54:00.665863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.26320","last_updated":"2026-05-25T20:35:48Z","snapshot_observed_at":"2026-07-06T23:36:11.031436Z","submitted_at":"2026-05-25T20:35:48Z","title":"MULTISEISMO: A Multimodal Seismic Dataset and Model for Cross-Modal Seismic Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:22:53.215257Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.26320"},"observation_digest":"sha256:e1a6cade57c67c8a3d23248e7b231bfc87284efc14100a5175a28173c38a2efb","observation_id":"043e5342-89fe-4824-b2f5-cef53576b92e","resolution":{"observed_at":"2026-06-29T22:23:59.913079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.27564","last_updated":"2026-05-26T18:36:42Z","snapshot_observed_at":"2026-07-30T04:13:30.453540Z","submitted_at":"2026-05-26T18:36:42Z","title":"The Future of Facts: Tracing the Factual Generation-Verification Gap","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T18:31:04.169632Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.27564"},"observation_digest":"sha256:62e593c2723064fea712d183d0b812fdf30c30095413ddb14a4bfe2c917e5c14","observation_id":"db54f728-3bf2-4e03-bdbf-8a8e2b8d32de","resolution":{"observed_at":"2026-06-29T18:33:50.402930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2605.31432","last_updated":"2026-05-29T15:27:26Z","snapshot_observed_at":"2026-07-06T23:40:36.926513Z","submitted_at":"2026-05-29T15:27:26Z","title":"DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:16:27.574100Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2605.31432"},"observation_digest":"sha256:789cacea8e7ed7c598c77b2be4913c2a208da7afd72282310d55c1bde1c4c806","observation_id":"06aeb066-d758-4876-b277-6bf484e2eab2","resolution":{"observed_at":"2026-07-01T19:36:09.049165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.00147","last_updated":"2026-05-29T03:06:14Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-29T03:06:14Z","title":"RAFT: Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-29T00:02:19.803078Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.00147"},"observation_digest":"sha256:3524814a901b8998bce43bc10dffa498caa5da517bfc2a819856f1de121b42d3","observation_id":"424d0c7d-918b-4566-ab4d-1c75c5420324","resolution":{"observed_at":"2026-06-29T00:02:49.592598Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.00460","last_updated":"2026-05-30T00:54:53Z","snapshot_observed_at":"2026-07-30T20:34:03.133280Z","submitted_at":"2026-05-30T00:54:53Z","title":"SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:19.422735Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.00460"},"observation_digest":"sha256:d282611c9476646648d0fc657eba068aa4e384d5ad90489b35ac83f0ccc345b1","observation_id":"30499a84-c286-415d-8e55-7667d0aac91f","resolution":{"observed_at":"2026-06-28T19:32:35.173932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.01413","last_updated":"2026-05-31T19:18:43Z","snapshot_observed_at":"2026-08-01T22:25:20.359400Z","submitted_at":"2026-05-31T19:18:43Z","title":"Differentially Private Datastore Generation for Retrieval-Augmented Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T16:39:27.164341Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.01413"},"observation_digest":"sha256:fb62f618c5716c8650ec771d1077a66357459520d89f3523e6e0945d8ae9635c","observation_id":"8f14a4ba-c57d-4d2a-94d3-ed1843609af7","resolution":{"observed_at":"2026-07-01T21:36:15.468352Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.03460","last_updated":"2026-06-02T10:37:38Z","snapshot_observed_at":"2026-07-31T21:02:59.160230Z","submitted_at":"2026-06-02T10:37:38Z","title":"From 3D Perception to Safety Reasoning: A Graph-Based Framework for Real-Time Underground Mine Monitoring","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T10:44:00.642366Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.03460"},"observation_digest":"sha256:34362228a5469baca621f02db30daed4456e4e60b92e244397f5d67221fe157a","observation_id":"dd674201-08e3-43c0-a27e-cf7529506a43","resolution":{"observed_at":"2026-07-02T02:46:27.755036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.04032","last_updated":"2026-06-04T17:08:43Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-01T20:59:05Z","title":"Do Transformers Need Three Projections? Systematic Study of QKV Variants","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T15:14:49.475561Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.04032"},"observation_digest":"sha256:0991141be41f599a7b0522cf8ede66ea23dcbe7b113050319529b4f9b33b079f","observation_id":"435a9621-9ee6-4fc8-9c4a-eb7f8b31320f","resolution":{"observed_at":"2026-07-01T22:36:17.325422Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.04474","last_updated":"2026-06-11T09:28:59Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T05:44:09Z","title":"Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:25.592270Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.04474"},"observation_digest":"sha256:f4a26419f17219f36788c2b87cc21242f59601574aa0b1f9aa7724105b262b0d","observation_id":"1f7d7371-2bed-413b-a1f7-63e608569244","resolution":{"observed_at":"2026-07-02T07:46:46.246146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-02T17:56:34.317060Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:43f41ead8fd4f0c838eff731fe688b7187da291176367154ffee0505618385b1","observation_id":"4f586ca6-4abe-43d3-8227-8289100e9a76","resolution":{"observed_at":"2026-07-02T10:46:52.330569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.05799","last_updated":"2026-06-04T07:27:53Z","snapshot_observed_at":"2026-08-01T16:45:43.555989Z","submitted_at":"2026-06-04T07:27:53Z","title":"CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T02:57:54.629402Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.05799"},"observation_digest":"sha256:229befad8b535e45a290a8c68b01f7424cc38557856590b3902e765bc83bb4ce","observation_id":"96a7e54d-9606-499a-974b-6bdb0496d58c","resolution":{"observed_at":"2026-07-02T11:46:55.971075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.06177","last_updated":"2026-06-04T13:52:21Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T13:52:21Z","title":"Ouvia: A User-centered Framework for Measuring Usability of Speech Translation in Real-World Communication Scenarios","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T01:11:56.037674Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.06177"},"observation_digest":"sha256:6b68cd3f512db918ae2baf75c17c16e9755ced7d2327194fc3da582a60423eea","observation_id":"0c21627d-9c6c-4692-a620-dc1ff02ddb33","resolution":{"observed_at":"2026-07-02T13:36:59.048458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.07167","last_updated":"2026-06-05T11:35:27Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:35:27Z","title":"UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T21:54:57.736518Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.07167"},"observation_digest":"sha256:5919f005ab7e9a96c9a1983dde7e389372fd6a356a9d9171719dcfdc4320a069","observation_id":"ed67616d-4ecc-4e8d-a061-ec2edc2ba58f","resolution":{"observed_at":"2026-07-02T17:37:15.018370Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.07608","last_updated":"2026-05-29T13:43:57Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-29T13:43:57Z","title":"Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:51:15.098039Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.07608"},"observation_digest":"sha256:a0b2085c6984bff6b849e76dfefc4df0c927e4972afe9a2486f2c09ddb69abb4","observation_id":"843a2925-253d-4f09-a27b-2f2af3eddc3b","resolution":{"observed_at":"2026-06-28T22:52:44.979232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-01T18:16:08.705690Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:9ef67050e221e74c34127445b6fb5b5240297b902791f8cc7cea37df81f3b6bf","observation_id":"af222d8e-548a-4726-bb9f-ee3dffeb813a","resolution":{"observed_at":"2026-07-01T23:06:21.441366Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.08565","last_updated":"2026-06-07T10:43:30Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T10:43:30Z","title":"EinSort: Sorting is All We Need for Tensorizing LLM","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:01.804061Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.08565"},"observation_digest":"sha256:3f716392f216033c0e37ffc38a536725d6868766a6ee7ddbc72dc9c61d272c02","observation_id":"80f64914-1c6f-483e-b062-253aec610cd6","resolution":{"observed_at":"2026-07-02T23:07:26.490409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T14:40:40.673091Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:d5877800085abdd621292ff940481d9f872f4e8d0810478bd4c0b8b887a92ad1","observation_id":"649b619d-444d-4692-8a82-376eec771c58","resolution":{"observed_at":"2026-07-03T03:47:35.737632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.01743/citation-record","integrity":"/paper/2503.01743/integrity","json":"/paper/2503.01743/citation-record.json","paper":"/paper/2503.01743"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-02T08:41:10.128841Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":"2412.08905","doi":"10.48550/arxiv.2412.08905","metadata_source":"pith","pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-07-11T00:47:43.055842Z","title":"Phi-4 Technical Report","venue":"cs.CL","work_id":"b6274271-7af9-4ee8-993b-ba1ba4205ba8","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:e51a1b7feb1ba9e05c34dea46c130f203df2ea74828b84cbf6556523a96387f1","observation_id":"c6b54e1f-1742-4df7-8671-a420a9af934a","resolution":{"observed_at":"2026-05-11T22:22:27.827502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-07-10T13:57:06.708632Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:6a7b9fa0a01e071f74519334fb507f553bda8cf4eac19e26b3c14fd279853da4","observation_id":"cc4a8c2d-201b-49c4-b918-a9f9822e660b","resolution":{"observed_at":"2026-05-11T22:22:27.598919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:b11f269cd1ae61a52288d63f371e211982306d2a26dea3c85e2182b27d4ffb3f","observation_id":"a367daaf-6138-4906-b78f-8600010187ec","resolution":{"observed_at":"2026-05-11T22:22:27.618918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:c55ea64e2e22753118779e3a0b11e8c0116bb5aee32fa35a0245d05cf1f62a73","observation_id":"ac13f7c7-ac1a-458a-b22a-cb0403bec366","resolution":{"observed_at":"2026-05-11T22:22:27.629998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-10T11:37:03.214945Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:7107dd5bd2fa6ecc0ec3e63418a8592f5be75d41c5e31740ba84975475b06383","observation_id":"1e0fe995-2dc4-4c5f-9b30-d352767e45fa","resolution":{"observed_at":"2026-05-11T22:22:27.640594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":"2308.11596","doi":"10.48550/arxiv.2308.11596","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"C.; Dale, D.; Dong, N.; Duquenne, P.-A.; Elsahar, H.; Gong, H.; Heffernan, K.; Hoffman, J.; et al","venue":null,"work_id":"9b58185d-8084-4802-9271-58d052a5af84","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:050ae29ae075d3d000113a3418bc9c689783de698a1d37e6b1faaa270e0d1b8c","observation_id":"5a1425e3-4730-43e6-9e81-1244100eafd3","resolution":{"observed_at":"2026-05-11T22:22:27.658413Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-07-06T08:40:06.727297Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":"1911.11641","doi":"10.48550/arxiv.1911.11641","metadata_source":"pith","pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":"cs.CL","work_id":"0d865a62-6376-4606-8d3a-eeb3b6e9ba6d","year":2019},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:eeced2c612d09c7c9dfe65ffa833ab9e4282416a01d0343f7f3ced2f59bfd2d1","observation_id":"853c25c5-6def-460c-9651-7b1dcaa73068","resolution":{"observed_at":"2026-05-17T14:55:18.098549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:289ad2585e787fdf3497013e1726e0c426acdd5b6e64a6cf8537f73c1ec140e6","observation_id":"86aae764-7ee3-4a0c-8152-b5a2ce7b2f43","resolution":{"observed_at":"2026-05-11T22:22:27.684224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"0be24034-99e0-4968-8660-335c9312df5f","year":2019},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:7ad0afd654342485dcc203fa7d9439021d7fc22ec89b302011a7a9b4a2a964bf","observation_id":"1faa8fbc-8fc9-45c1-bfb4-71cbdf4a149f","resolution":{"observed_at":"2026-05-11T22:22:28.195230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech","venue":null,"work_id":"48ef8ad4-647c-4724-b5ab-b04562f1d051","year":2022},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:0a5805a3412ba004c857fce1c7b60ffaf3b28cb91e9e9db3e3bfaaee5d4174ed","observation_id":"0a0a9faf-59aa-49ac-9657-e0cf7d262a49","resolution":{"observed_at":"2026-05-11T22:22:28.211121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-07-11T01:17:44.298728Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:6b0c959afac65dcea2c01e02ce35e1d546ae84c558cfecb88af8ec96d12f07e8","observation_id":"3a059973-2a2b-4636-9b9f-9ab0c3887ebe","resolution":{"observed_at":"2026-05-11T22:22:27.842608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:d0680a2d28a21581ac8a7c1bab40e1931b9994100139b3a52b978bef6d73fe4e","observation_id":"c7a11588-f703-4351-9c61-23e4cc1b9ad3","resolution":{"observed_at":"2026-05-12T20:58:59.653229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-10T12:57:07.670593Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:dc0249a05336fc7a4d49e8472425d31fb4680bfc4809171c80b4bbd7c4f3df40","observation_id":"0be5604f-6156-400f-90c1-811155d64806","resolution":{"observed_at":"2026-05-11T22:22:27.887359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:e4aef6cd21c93c71787d12cce6cb481b30db6fe8334bb5ade37a74227b7a6b0e","observation_id":"951b5426-f4ed-4f0a-983e-cc0efc7b2ecd","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:54d500597eb49a135e8b4b22a2d5d7bdef091d8b3391cb729a87cf25e8f90935","observation_id":"a8adfca7-6afb-47be-9979-59c4881f0f9c","resolution":{"observed_at":"2026-05-11T22:22:27.929950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2409.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-07-02T02:56:29.429018Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","venue":null,"work_id":"05897a70-23cd-425f-b903-02c1293c04a0","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:1614d059045adb36ef9e9385e073f654b63fa3e810c95e8557679699ed57afc4","observation_id":"ac6a79fd-1b7d-415d-ac27-11b631a7e9c9","resolution":{"observed_at":"2026-05-11T22:22:27.942674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-07-06T17:22:03.122430Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":"2401.16420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-07-04T19:50:11.273770Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","venue":"cs.CV","work_id":"93411487-d575-4b44-9d9e-2374874a66bd","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:218ddf13e818d6506e74b0797f875cd73f5896d43f0e4f38aa0938ba27023982","observation_id":"cfc165d0-00e0-4861-a4cc-ae115cef8770","resolution":{"observed_at":"2026-05-17T05:30:28.063870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:a8b7a8db2a97830dbaddc10dd999a6cc5d996c2fb5ee30b03449d80206a7fe14","observation_id":"2e39c14c-8d32-4b9b-9453-ec93b0e661ce","resolution":{"observed_at":"2026-05-11T22:22:27.974405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:0181c2ce2b24809a546835b08b603a8c3a1efaafc8804b3b45c02506a4fb1f03","observation_id":"cb91d072-e5e7-429c-b9d4-f256aecc44af","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiochatllama: Towards general-purpose speech abilities for llms","venue":null,"work_id":"9c344f67-53b5-4a60-9ecf-85b755ce1d75","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:d01f604020dcaf399baad3de3dfc00348ef3da915ffef84bf1a19e995bfe4fff","observation_id":"073f4210-4bfd-4aab-ad56-feccfb6dfc50","resolution":{"observed_at":"2026-05-11T22:22:28.229639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint audio and speech understanding","venue":null,"work_id":"395320a2-9a3c-4108-8145-1c4d9292865c","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:6fa641796f15f8cae34e60d1d2af26bb8819f5b79865a5a73bfb66acdc8f0d17","observation_id":"48cb63da-7dd0-4086-87bd-a5f0a67c8f9d","resolution":{"observed_at":"2026-05-11T22:22:28.242536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":"dffba59e-b46d-4403-80c4-c0cc2e1405f6","year":2020},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:2e9fe7f82ced9d6a5baed39f8eb0b6f2ba624ea3b69f04b52631c8d1e17cc579","observation_id":"538d58b4-7391-4752-af4f-70ac42e45fa0","resolution":{"observed_at":"2026-05-11T22:22:28.248124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:1de232bcba38c0e1ad1eaadbe68dad65369aad03a740dd10d3430b886c7c982e","observation_id":"603a0f70-7dc0-45ef-acb9-4082d8366ef4","resolution":{"observed_at":"2026-05-11T22:22:28.002945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:899259bf07d5779077b12a32c6c2bc357bf523191db4daf2852bf9a2476a0c00","observation_id":"357f1c9f-f3fa-4729-a656-9f00bb096e5e","resolution":{"observed_at":"2026-05-11T22:22:28.020311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T01:08:06.256034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:4a6e020b82ec52f4aca6ce9519cce87e9604b9d6e8877b7ab58e6e1fcf20c924","observation_id":"0a8e7430-2547-4ca4-a50f-a1ec18d00da1","resolution":{"observed_at":"2026-05-11T22:22:28.028354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.04997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:50.774737Z","title":"Llm2clip: Powerful language model unlock richer visual representation.arXiv preprint arXiv:2411.04997","venue":null,"work_id":"78f35a1a-a9da-43e6-9ad3-31eee39680d6","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:40cb9710d50d81426172e53321d3e001c623859c2778c144fbb09a025a23cdb4","observation_id":"70a8d384-67ab-46f0-b5ec-c1d024c3c516","resolution":{"observed_at":"2026-05-11T22:22:28.041542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:5929e0b3dcf2ec591133323e83c97f95a355d9714bfbd9c8a430ef8070c0acab","observation_id":"835fd8aa-9747-47af-8739-3f54d9f683b5","resolution":{"observed_at":"2026-05-11T22:22:28.052476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[LBX+24] Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, and Jianfeng Gao","venue":null,"work_id":"8efeba7d-8712-4b57-afa0-3520e99417d4","year":2025},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:7b982f6d3790fb5b0dfb4b1b3d62efe9fd3c7492d45ee749b9da06830b7b3cf6","observation_id":"462faadc-9f2d-4962-9074-c05666608f0e","resolution":{"observed_at":"2026-05-11T22:22:28.297769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:e866152431b57f7de4cf6b83cb853c3693750f099aa39b744bd6fde85b65a9e6","observation_id":"5c790fe7-78b1-4371-99d8-da30fb8126cc","resolution":{"observed_at":"2026-05-11T22:22:28.062136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12915","last_updated":"2024-01-23T17:07:18Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:07:18Z","title":"Red Teaming Visual Language Models","version":1},"cited_work":{"arxiv_id":"2401.12915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12915","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Red teaming visual language models","venue":null,"work_id":"a8dec2ba-3e89-4e7b-8986-f60d653f8925","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2401.12915","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:8f63e4180306cd6fc80ce1f60a82607ca7bca12817c8a7f3f3c0e9d2d198ff37","observation_id":"aab323ed-6852-4e11-8995-334ee85bf04c","resolution":{"observed_at":"2026-05-11T22:22:28.068521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-02T19:02:29.937924Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-07-10T13:57:06.723769Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:b1ff364c5bc680f8884ee8de9dd2d4d3c8b3c035b0b046874f8ef9b9afb8117e","observation_id":"fd5de2bb-c7be-4f87-bf34-5a3b69153488","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:84691c495ceaa58a1c18d12e88bb717a84f3b706c3545123c07dc59cdae8b7ee","observation_id":"e19f28f0-ed57-49c5-90b5-9df326138136","resolution":{"observed_at":"2026-05-11T22:22:28.089575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination–aime","venue":null,"work_id":"50f56904-a2e6-4ff9-9d6f-ec2c08472a45","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:dfcca943bce1e4add98bb780a2e0c780b9e81ab752723356acebc270a4a13a0c","observation_id":"51e28001-376d-4aa2-9742-47d02087c54e","resolution":{"observed_at":"2026-05-11T22:22:28.291545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13833","last_updated":"2024-08-23T00:04:31Z","snapshot_observed_at":"2026-07-06T18:48:42.015848Z","submitted_at":"2024-07-18T18:06:59Z","title":"Phi-3 Safety Post-Training: Aligning Language Models with a \"Break-Fix\" Cycle","version":2},"cited_work":{"arxiv_id":"2407.13833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13833","snapshot_observed_at":"2026-07-04T18:10:00.725443Z","title":"Phi-3 safety post-training: Aligning language models with a ``break-fix''' cycle","venue":null,"work_id":"93a8931b-1823-4f05-86d6-713504477eea","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2407.13833","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:560ec52494099a74ce26861269fd65aec936e71175810e67b5c1a7d9a97d9e3a","observation_id":"5d366aa7-3bfc-495d-ba6d-dad78571317d","resolution":{"observed_at":"2026-05-11T22:22:28.098692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"a2ef4e1e-dd95-4386-9e9d-1f2099c4325f","year":2022},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:7f2810d9bf6d11ceba7fa302aa5d4d293c0d61c0f8334c82cba7aa4a06372d4c","observation_id":"682f4fef-587f-4785-ae4c-2914a410cca8","resolution":{"observed_at":"2026-05-11T22:22:28.265591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:7a83fabb4538e75f56b747bbbcba139f8b94826e3a18e5becace4995bccfded4","observation_id":"1c10b859-8f3a-4ad8-9ab6-d80841c52553","resolution":{"observed_at":"2026-05-11T22:22:28.105516Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"57ae6d8a-e6cd-44d0-b12e-c584c10dc71d","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:cd9ff10e071b51d880eb710543c1cffa5a7be6a822d9c0d0eeb3219950b5b17c","observation_id":"d8b6ce4a-1bdd-4baf-aefd-d430af5807b6","resolution":{"observed_at":"2026-05-11T22:22:28.281517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":"1907.10641","doi":"10.48550/arxiv.1907.10641","metadata_source":"pith","pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":"cs.CL","work_id":"9587a902-54ad-434e-9cbc-bdfe54b5d3bf","year":2019},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:70cc2d66dc88ae35181d84a6b69f499ab157335cda43e82a912a66b34b8fcb38","observation_id":"04e502c6-18df-4333-9084-149b01fb5adc","resolution":{"observed_at":"2026-05-14T17:20:15.117976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":"1904.09728","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-07-08T01:44:26.198243Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","venue":"cs.CL","work_id":"3f93670e-0ae7-40e5-bed5-74c216638dd1","year":2019},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:520f25dd8d3c6b40dac529936c52ae66a9855d7f83f7d31fddbe06849f1edc9e","observation_id":"77834b61-efb2-47c0-b102-4e45ffcf2f31","resolution":{"observed_at":"2026-05-13T12:22:26.192007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":"2206.04615","doi":"10.1162/tacl_a_00688","metadata_source":"pith","pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","venue":"cs.CL","work_id":"bb63abb3-0d50-4362-b97c-b5e725b03b39","year":2022},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:97df71f288dfd0aef02e105b1cbe4fca5fa1579684f90e825aac01ed4819d56d","observation_id":"2ad8cbf1-a96d-4bee-a255-1e061f6aeede","resolution":{"observed_at":"2026-05-11T22:22:28.139480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2410.19168","doi":"10.48550/arxiv.2410.19168","metadata_source":"pith","pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","venue":"eess.AS","work_id":"e60f85db-636c-4830-af85-5d31ebc74a1b","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:1c88e3b3ac07f686eb75b00a9487cf99834ea1110dce11aa364d28d1ad0319e5","observation_id":"df1f6ee2-b138-4566-a6bc-dfb3f59c20d5","resolution":{"observed_at":"2026-05-13T14:04:55.589197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:cda9bb0409956f9d4975780f2124b6ba3ffa054660da8a3302c00847269d0544","observation_id":"3823b17c-5a9d-4351-b21e-f6d63a1eda20","resolution":{"observed_at":"2026-05-11T22:22:28.160647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:95a81dc46d99aaa09e17cbe750b28ef5d5f8235ce59a662a68152d8026aa2c9c","observation_id":"b8d9ed14-0905-4955-96cf-3b85e68f5226","resolution":{"observed_at":"2026-05-11T22:22:28.171212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:d0aa2d38ad0334859df1b742055770d17b1bb46b10ff47dd26acb97570441d33","observation_id":"9ac5b64d-3da6-4e3e-8bc4-74ece11226b0","resolution":{"observed_at":"2026-05-11T22:22:28.180304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:3dc97e44cb5a49b40e3d72ce7e1dd3e08a4cc38c7d9e48c164d385204bda2c71","observation_id":"e5b681c1-99f6-46aa-a744-03fd1880f7fa","resolution":{"observed_at":"2026-05-11T22:22:28.189326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11465","last_updated":"2022-05-23T17:02:07Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:02:07Z","title":"SQuALITY: Building a Long-Document Summarization Dataset the Hard Way","version":1},"cited_work":{"arxiv_id":"2205.11465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.11465","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bow- man","venue":null,"work_id":"3ed4f86e-f10a-4e9e-9316-d8183184d820","year":null},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2205.11465","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:7668c015605189c2707aa3871aaf1ba2ed7c66c53913713bb026d2f1c6cdca42","observation_id":"6c1efb9b-3909-43c1-b2d1-7091cdabdc2a","resolution":{"observed_at":"2026-05-11T22:22:27.693553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Covost 2 and massively multilin- gual speech translation","venue":null,"work_id":"14b592a2-c6e8-4fbe-bb0e-77f7a303161c","year":2021},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:eb1322b97b30347ce73c1f7fd588660d6dff54b733e461a7026b9c521fe36eab","observation_id":"8990929a-fe4b-408f-af02-62258c2dcb4b","resolution":{"observed_at":"2026-05-11T22:22:28.271000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":"2410.11190","doi":"10.48550/arxiv.2410.11190","metadata_source":"pith","pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mini-omni2: Towards open-source gpt-4o with vision, speech and duplex capabilities","venue":"eess.AS","work_id":"104f05e3-a490-4b69-90dc-68a70e9c5355","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:011e1aff2ed4f6f159a16a6e14114f4cd01e416b9d4eaa32495f08de508a6241","observation_id":"6809925f-4b03-49bd-89e9-1edaa1d13904","resolution":{"observed_at":"2026-05-11T22:22:27.710097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":"2502.03387","doi":"10.48550/arxiv.2502.03387","metadata_source":"pith","pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"LIMO: Less is More for Reasoning","venue":"cs.CL","work_id":"04106d5b-ee5a-4d24-b54a-afec9c42d290","year":2025},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:2c03e2e0fa9194b327d52ac35438bb639cfb79195e649e586907bdd39e8d3d20","observation_id":"0b29ff4f-6dda-483e-bc91-7765c994cb15","resolution":{"observed_at":"2026-05-17T02:11:37.899840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AIR-bench: Benchmarking large audio-language models via generative comprehension","venue":null,"work_id":"0dc9769f-3814-4a31-a2b2-2c9f8a28b33d","year":1979},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:cb9672b1dee5fd4a2e63a3883402405ca3f5b5df63838407af7cfd0701ae6b48","observation_id":"2ce20adf-103f-4274-952b-153118eaa12a","resolution":{"observed_at":"2026-05-11T22:22:28.258493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:5a6911fe50d51d2e7e8fd77f9b7e2e965dd1769e58e936e186bd562887637f4b","observation_id":"8182dada-8e4e-4b85-b829-818fd0c1e904","resolution":{"observed_at":"2026-05-11T22:22:27.732347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:6f0cdd3b6927f2536d77da85d94b359cb092a172c70246dde584c8b84b1b985c","observation_id":"51e1c557-58a4-4bf6-889e-06feafbedde0","resolution":{"observed_at":"2026-05-14T00:51:48.633687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08887","last_updated":"2019-02-02T23:53:18Z","snapshot_observed_at":"2026-07-06T07:03:52.901427Z","submitted_at":"2018-09-24T13:03:13Z","title":"Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task","version":5},"cited_work":{"arxiv_id":"1809.08887","doi":"10.48550/arxiv.1809.08887","metadata_source":"pith","pith_arxiv_id":"1809.08887","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task","venue":"cs.CL","work_id":"d2ccf2d9-7f71-4982-8052-15f370aa5dfd","year":2018},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/1809.08887","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:c80b74ea2a50899700af7ffe52340ff91bce71168ce5adfc5b286c12dc9e9c7f","observation_id":"aeb0577f-abd5-4ab6-bc11-1462b817b8cc","resolution":{"observed_at":"2026-05-11T22:22:27.759237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-03T17:32:49.939927Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.02207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-07-04T00:39:16.634455Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models","venue":null,"work_id":"fa73b2d0-676c-4494-a528-ee3d216fd3b8","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:914b41e5dd1c62d06dddace6edc9e6d3a44c2a9d89296e7c536892885c2f2e7f","observation_id":"8483c4d9-565f-4c1c-a4cd-6bf3729d0d31","resolution":{"observed_at":"2026-05-11T22:22:27.772873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":"2412.09596","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-07-04T03:19:29.961741Z","title":"Internlm-xcomposer2","venue":null,"work_id":"cb73923b-ac69-41ed-96d6-8508ba1df8d0","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:7dd3cac61f905e48610ac26e252d16b7472de0e80f77bbb95f35b5f30040de12","observation_id":"75b57934-9208-4775-af26-56708e043fd2","resolution":{"observed_at":"2026-05-11T22:22:27.783266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:09b79c17da2264965f130fbd2a94c3698aa073cd678a111d9392d4bdd10d193f","observation_id":"e4f0b3ff-3453-4591-a366-942211b6c35c","resolution":{"observed_at":"2026-05-16T03:53:47.697648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:114e7c498570dc5326c04977ad55448db7542f235cc080a3c680eb177c2100ae","observation_id":"86149ad6-9a2a-4921-a378-1339e2d11331","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":"2406.15877","doi":"10.48550/arxiv.2406.15877","metadata_source":"pith","pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","venue":"cs.SE","work_id":"14715c3c-002c-4bc4-8882-f7c586954d62","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:dd0bf87bbdfa3dd37916797a31928a0d286b44d8174eeb032ed62aaefedc64cd","observation_id":"2e30a073-f24a-4245-a6ac-28c6e8cab7f1","resolution":{"observed_at":"2026-05-14T19:30:10.582609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":45,"verified_fuzzy":11},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 100 inbound Pith citation observations for arXiv:2503.01743."}