{"as_of":"2026-08-07T23:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39a3a7538644bb22dd3166189609102ce40b01d28c4662ba3e14301ecbda74fa","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":47,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:46:15.480907Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:49:39.565893Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":220,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:274d1c847d28d2ebf77636fe6393d1875f5a199ada68c68c4e2200bb8ef17cd2","observation_id":"63d04862-f1a2-4fe4-9032-23211b9dec67","resolution":{"observed_at":"2026-05-19T11:08:27.787101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:8c4b17f59956d2d7bf67267d2003e1a33f1489b8e82caf686d7059a65dc9f998","observation_id":"6ae4961c-ef96-458c-9340-fd90ed497a19","resolution":{"observed_at":"2026-05-11T10:09:23.665883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:b9840e02900e45e9dfd9f16471364582e5c0da16c2d2a7eef51b246bb1c624ee","observation_id":"7f7d654c-d3c0-4c4c-a437-1618750f0f72","resolution":{"observed_at":"2026-05-23T05:45:28.351105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:0dad5c7d61e66ced818d128ba308160faf573e42ade168ab0fd2f2a9db127406","observation_id":"760a6262-90f3-4eb9-8b22-62e863cfc59e","resolution":{"observed_at":"2026-05-16T11:39:22.513505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:bf9454c7cc47c952eef2a487321355443e1b1d664fa4ad0b28d065c855e1c92f","observation_id":"c5f32c4e-ddd6-47aa-8090-8408a836f07f","resolution":{"observed_at":"2026-05-14T00:32:41.254763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T14:46:15.480907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17629","last_updated":"2025-05-27T07:41:51Z","snapshot_observed_at":"2026-08-07T14:41:15.860384Z","submitted_at":"2025-05-23T08:39:06Z","title":"TransBench: Breaking Barriers for Transferable Graphical User Interface Agents in Dynamic Digital Environments","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:46:15.480907Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2505.17629"},"observation_digest":"sha256:1881f33fb454fa77a8111aecf240eaca6a99c86c382d9c4c8c37fcdb014edf65","observation_id":"8821343c-b7a2-4f6e-811a-0b539bf251f3","resolution":{"observed_at":"2026-08-07T14:46:15.480907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T12:48:02.870434Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-07T12:43:01.932268Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.870434Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:3b35759301aeec659c406756adf5473278d6b2127ee045396f42191bb5574fbb","observation_id":"7e7399e0-866e-4842-a160-4c0336e41f05","resolution":{"observed_at":"2026-08-07T12:48:02.870434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T11:59:07.178112Z","title":"Aria: An open multimodal native mixture-of-experts model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-07T11:51:01.535430Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.178112Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:3f26345cb90b3984ed1bc188384bca912e5ee0fd4138b1d9f622ff3198f03131","observation_id":"21cc2dfd-dfd4-44a1-b1c5-5e5e52635d85","resolution":{"observed_at":"2026-08-07T11:59:07.178112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:56:05.321429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-07T10:47:31.423763Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.321429Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a922651c2d191794be011f274d520073ca52b747d208a4ed7e3b045794b2e89e","observation_id":"264fb417-cc39-45a4-a218-e19a0cc9fa8d","resolution":{"observed_at":"2026-08-07T10:56:05.321429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:55:14.699207Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.699207Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:20d9ffce2c4591cff24e0b337f5fcc13b22a89a8114f8eff2be2a7edffd273ce","observation_id":"956df445-02d3-43c9-ba84-4aa92a14787f","resolution":{"observed_at":"2026-08-07T10:55:14.699207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:25:36.269793Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-07T16:25:46.738574Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.269793Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:d5c5673c1fe89b3ec855a6e38db8ae349aa01a4695ebf73be0d83843ea951f62","observation_id":"5aa974a3-aacc-4d02-a416-d2cbbb1fc859","resolution":{"observed_at":"2026-08-07T10:25:36.269793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T06:00:56.895831Z","title":"Aria: An open multimodal native mixture-of-experts model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-07T21:48:03.079145Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:56.895831Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:3579bfc57e32a6297d4143a8130302860c1ce20e7ec7d323b99598b84f16b733","observation_id":"61a95390-c468-4b95-992e-c6f6636ede24","resolution":{"observed_at":"2026-08-07T06:00:56.895831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T06:07:18.685096Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06406","last_updated":"2025-06-25T12:36:55Z","snapshot_observed_at":"2026-08-07T11:49:17.219924Z","submitted_at":"2025-06-06T12:47:29Z","title":"SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:18.685096Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.06406"},"observation_digest":"sha256:a0ec641b7f7e1c4b764b87472bafd139d5f6a8174893d9ce635ddaef87c13b4d","observation_id":"f1bce6f4-2bd2-43e1-b54c-0a8033a0e85c","resolution":{"observed_at":"2026-08-07T06:07:18.685096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T05:26:47.142398Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.142398Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:a42c5d7e2b0c61153cd90385e54282cc796d3bb52fd7b72c29e13c19fccf3213","observation_id":"b92b4578-1639-44c9-8c4e-488ab0c0a9d5","resolution":{"observed_at":"2026-08-07T05:26:47.142398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T04:22:55.888224Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-07T04:13:50.591653Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.888224Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:22bd3377b3a47b87d2f1c7ed87fb171563ef3188ba87f3b163770bc65f1b6a41","observation_id":"bdeedada-c8a1-4732-8f62-8830251ce4c6","resolution":{"observed_at":"2026-08-07T04:22:55.888224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T00:45:03.582120Z","title":"Aria: An open multi- modal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.582120Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:e5538b173cca7fbce2c4f866d3e177aedab4d57fd8dd82865f1d7f2ed9ef613d","observation_id":"03a9cf9c-51af-453e-893c-cbad769da65f","resolution":{"observed_at":"2026-08-07T00:45:03.582120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T00:34:03.076564Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.076564Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:9cc969a6e97d118b525da3d384568efe8b9f0e301eefc55185e3dada10332f78","observation_id":"d45607f7-0eeb-4f4a-9271-0dce9d0007ae","resolution":{"observed_at":"2026-08-07T00:34:03.076564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:2b9c84d124a1e88b470bea2188981b9e7b5c17d614e208f4da032a0d6a250975","observation_id":"e9d3eefd-96c8-4e8b-ad0a-a00b44db0101","resolution":{"observed_at":"2026-05-16T15:27:04.381238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:52:18.651138Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.651138Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:51f527d2b94ed9ba66ebb6c3b8d09dc6346f0e2222182f23ece598460104e608","observation_id":"84e3669f-09fa-4e89-bf38-aecdd5b59f7a","resolution":{"observed_at":"2026-08-06T21:52:18.651138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:12:03.532425Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-06T21:04:06.353517Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.532425Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:383d1d54aa23b8259e1a293fef921a3a63d32f1c2867ddc6fb184ae41f8f31cb","observation_id":"eead32a8-c627-48ac-b545-2cbbaea125dc","resolution":{"observed_at":"2026-08-06T21:12:03.532425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T20:53:20.062315Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.062315Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:fff221c0b85fd439e860c48f4bbc0d805c7bf6cc74a3ec32f6298f2feb47fedd","observation_id":"81842245-3584-42af-815f-d44d8e3626c9","resolution":{"observed_at":"2026-08-06T20:53:20.062315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T20:29:51.704165Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.704165Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:c528056fa570be74773ef2217d1d6285017bf647066653ec50a05abecf78363a","observation_id":"67cf1236-7fa1-4118-8cbe-6711b0775924","resolution":{"observed_at":"2026-08-06T20:29:51.704165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T23:12:00.379646Z","title":", Liu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02904","last_updated":"2025-06-24T06:08:35Z","snapshot_observed_at":"2026-08-06T23:04:34.180895Z","submitted_at":"2025-06-24T06:08:35Z","title":"Enhancing Sports Strategy with Video Analytics and Data Mining: Assessing the effectiveness of Multimodal LLMs in tennis video analysis","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:12:00.379646Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.02904"},"observation_digest":"sha256:834e8a87fb5bd58774c7ee91e2bf2ee0cd781a1073a822ba8be1cdfbe5e1f37f","observation_id":"9e98d311-ebb1-4b89-86f5-713a3c31b6e6","resolution":{"observed_at":"2026-08-06T23:12:00.379646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T18:16:28.576320Z","title":"Aria: An open multimodal native mixture-of-experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-06T18:05:15.934788Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.576320Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:7a6891f6685c12bf83684b871ec604cd9ab6d863075845d154232a7e140b3c24","observation_id":"a3e25417-5864-4888-a920-35b88ceee824","resolution":{"observed_at":"2026-08-06T18:16:28.576320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T16:49:59.827141Z","title":"Aria: An open multimodal native mixture-of- experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.827141Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ee9dc8d8ac8fc77590d22f60cd6d3ba4b2f88c7778498c036ad7aed25a17074b","observation_id":"5512c647-879c-48fd-b611-5cd6e6d1ced4","resolution":{"observed_at":"2026-08-06T16:49:59.827141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:30:35.065340Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.065340Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:50f13b9fac364d3a8735291850aaa01a86921735f9b70e22831e4f2729227788","observation_id":"25639214-899c-434e-956e-1357c905573c","resolution":{"observed_at":"2026-08-06T05:30:35.065340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:15:42.093183Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-06T05:14:34.110582Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:42.093183Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:eddaaf48903e05deef0776ecfcdf022884abd15aa84414b03ffe3328ad8c4f38","observation_id":"27fc9e3e-772a-4fb5-8274-f53805fd91b9","resolution":{"observed_at":"2026-08-06T05:15:42.093183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:12:35.830990Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-07T23:12:10.034346Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.830990Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:3e44d411e8c4f27ac60db9f02b208d50ce5f42ba3ecce66a4897259946abddd2","observation_id":"967cacbc-4c71-454c-96d2-8db4b59de9d3","resolution":{"observed_at":"2026-08-06T05:12:35.830990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-05T19:03:10.590321Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-07T22:12:36.581972Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:10.590321Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:fcd9aca25a08e071783ce1e0a3f1de76223b282daf20b07e265b29e796233882","observation_id":"525d0f11-90c8-43dc-9609-5537117c5b0f","resolution":{"observed_at":"2026-08-05T19:03:10.590321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-05T12:44:46.702453Z","title":"Aria: An open multimodal native mixture-of-experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01341","last_updated":"2025-09-01T10:23:48Z","snapshot_observed_at":"2026-08-07T06:46:34.681356Z","submitted_at":"2025-09-01T10:23:48Z","title":"Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T12:44:46.702453Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.01341"},"observation_digest":"sha256:6c50beb353ddbff0f529932d108fa656b2d84f15589b4004deb802cf59c64c13","observation_id":"748abe4c-ecc3-4ce2-9b2c-bce63cc6da9b","resolution":{"observed_at":"2026-08-05T12:44:46.702453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:55.500268Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.07969"},"observation_digest":"sha256:523ded59bde43686deb0e91070b440aa9e81f9e4b4f95141d599d74977d32c63","observation_id":"4decabbf-88ca-4b45-9f26-4fc0e6e38fec","resolution":{"observed_at":"2026-05-18T01:17:55.677423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-04T20:32:56.586319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.586319Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d5352b5ee5b74ee1c21ea25562467e269d16ac6bfd779cc3208a9818daabbc5d","observation_id":"a133ce72-f350-4e46-b0ab-30c9f0976478","resolution":{"observed_at":"2026-08-04T20:32:56.586319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-04T17:46:56.236585Z","title":"ARIA: An Open Multimodal Native Mixture-of- Experts Model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12263","last_updated":"2026-05-31T19:40:08Z","snapshot_observed_at":"2026-08-07T01:42:01.882356Z","submitted_at":"2025-09-12T20:07:12Z","title":"InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:46:56.236585Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.12263"},"observation_digest":"sha256:a0790e1c7448e0ffa7eefd5407c20d25409ab5813fda67807a36090a67331c28","observation_id":"f84a2837-f958-4a6f-b14a-661a3cf0974f","resolution":{"observed_at":"2026-08-04T17:46:56.236585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-02T12:38:41.181077Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:71d61bfe84f14d62e02a2356c5ff59a1104c7ada9638bc2155e66194852bc7c4","observation_id":"6a12fce7-745b-41bb-aa36-4dfe8bc923bf","resolution":{"observed_at":"2026-05-15T20:01:33.431023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-03T01:38:19.340462Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:48a3b6d1616934b9ef457b50aecdb64e28d1efb09d01d10df1e694222d434d07","observation_id":"20fe5682-f600-44dc-a371-8c6b83588456","resolution":{"observed_at":"2026-05-10T23:15:50.236502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-07-31T12:03:21.545054Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:3dcb513e91c037b4c5a14700ac2fb3cf5f4c211a914e7bb1d7589c541173f902","observation_id":"cf2041fa-7470-46f5-a5cf-576a911d4d48","resolution":{"observed_at":"2026-05-11T12:31:08.078362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2604.20486","last_updated":"2026-04-22T12:20:46Z","snapshot_observed_at":"2026-08-06T20:38:43.258492Z","submitted_at":"2026-04-22T12:20:46Z","title":"ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T01:12:17.469552Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2604.20486"},"observation_digest":"sha256:5d8554d20b15f9b5924f909db36fa1cf8ab8463c5934335d8e73b2997fff203b","observation_id":"207c8141-ec26-4d31-a20d-2de2f3daa16c","resolution":{"observed_at":"2026-05-11T13:41:10.087841Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-02T16:55:37.869194Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:86b84d4ef6b146de217e95e579f1fc17aa361732313654601a7464df52c44b34","observation_id":"8c1a6100-ea69-4415-b286-51f3fb6d7d16","resolution":{"observed_at":"2026-05-20T14:48:23.469466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:eca9744d2f3c9488fedf0b979341bd8b30aa3b0e51e282f778adbb71c1469572","observation_id":"f31884c4-788a-4c9a-a17b-e330fee1ded4","resolution":{"observed_at":"2026-06-29T22:13:59.644704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2605.27358","last_updated":"2026-05-26T17:58:24Z","snapshot_observed_at":"2026-07-06T23:37:02.891611Z","submitted_at":"2026-05-26T17:58:24Z","title":"MobileMoE: Scaling On-Device Mixture of Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T18:48:50.656971Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2605.27358"},"observation_digest":"sha256:b7b29da94caa080dfc81b34a3d4a5a397eeef240e098211ce941a2527ea78467","observation_id":"75332c6c-2cce-4d14-97c2-1754d2c6854d","resolution":{"observed_at":"2026-06-29T18:53:51.431424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.00275","last_updated":"2026-05-29T19:08:20Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T19:08:20Z","title":"Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T22:43:33.929871Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.00275"},"observation_digest":"sha256:e4f28ec05fccaf02525700b837c26ca707c4fa8059b0a9f5e978203dbfefd711","observation_id":"36825118-971b-4ca7-b7a7-0ee70fab0eb3","resolution":{"observed_at":"2026-07-01T19:26:00.060381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:c786cc730d1dabc015b647ed408d7091479b7a5114226c2cccf87200d142e181","observation_id":"78e9bca3-f6e7-40d1-9b2c-92288425112e","resolution":{"observed_at":"2026-07-03T14:28:32.081900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:d0364456ec5296b935f2db51ae16dc84601a821277f2bf3adfa3ca9974b5c8d8","observation_id":"c308a88b-ff1d-4416-a119-d94f25a1d378","resolution":{"observed_at":"2026-07-04T03:49:30.343170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:3c20d4312da74587874cf6711c95774bdffbdbbed5e887c8694615039a4ac874","observation_id":"11cbdc20-f013-4cad-adfc-486ee162293d","resolution":{"observed_at":"2026-07-04T06:39:37.708094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.21868","last_updated":"2026-06-20T04:10:34Z","snapshot_observed_at":"2026-08-06T05:17:32.033245Z","submitted_at":"2026-06-20T04:10:34Z","title":"WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T12:40:53.103233Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.21868"},"observation_digest":"sha256:805410486d324ac4ec9b28f10b0a7c3b6da583ff059446dc1176be32f1ad9c10","observation_id":"834e8346-8de0-4ee5-8cd5-66661c36e10b","resolution":{"observed_at":"2026-07-04T07:49:39.567377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T23:51:36.918993Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04454","last_updated":"2026-08-05T05:09:20Z","snapshot_observed_at":"2026-08-07T23:15:55.124398Z","submitted_at":"2026-08-05T05:09:20Z","title":"Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:51:36.918993Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2608.04454"},"observation_digest":"sha256:0d8a1f6299c540c1896083faaac0da9f6f559864d7e618ae836bbd0378f86cab","observation_id":"af36094b-e3bd-4a0e-94ea-65fee3fc4322","resolution":{"observed_at":"2026-08-06T23:51:36.918993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T11:55:27.943328Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-07T23:19:51.530954Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:27.943328Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:ae6af30e09c5a78b55033750e52a2904b0686a37a483264a59466fad00d734f0","observation_id":"73900df1-0d7c-4843-b1c9-72d742d9c704","resolution":{"observed_at":"2026-08-06T11:55:27.943328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.05993/citation-record","integrity":"/paper/2410.05993/integrity","json":"/paper/2410.05993/citation-record.json","paper":"/paper/2410.05993"},"outbound":[],"paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 47 inbound Pith citation observations for arXiv:2410.05993."}