{"as_of":"2026-08-06T14:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3280ec8390b4f46838fa50892804b9dace71e170176c12929bffe037aeb162b2","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T17:53:49.388949Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.03716/citation-record","integrity":"/paper/2605.03716/integrity","json":"/paper/2605.03716/citation-record.json","paper":"/paper/2605.03716"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.14394","last_updated":"2024-03-27T03:23:12Z","snapshot_observed_at":"2026-08-03T15:15:24.715402Z","submitted_at":"2023-04-27T17:56:29Z","title":"Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking","version":3},"cited_work":{"arxiv_id":"2304.14394","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14394","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2304.14394 , year=","venue":null,"work_id":"9c2824c2-3cb7-4651-8151-f52174a2b057","year":2024},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2304.14394","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:f0d2e55acf18aead5c1cb33071abccc468310053889c57bda9885e468c80b6c7","observation_id":"c93821f0-864e-433e-9b50-04a5da34a206","resolution":{"observed_at":"2026-05-11T23:16:14.285188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:bcadd6879badab3030064f5874c0cc618dbe22e67fa3f4e11c6e3f8382182634","observation_id":"62264369-fccd-43e5-be1a-67c73fb738bb","resolution":{"observed_at":"2026-05-11T23:16:14.252534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19434","last_updated":"2025-05-26T02:53:12Z","snapshot_observed_at":"2026-08-05T18:21:24.333723Z","submitted_at":"2025-05-26T02:53:12Z","title":"CSTrack: Enhancing RGB-X Tracking via Compact Spatiotemporal Features","version":1},"cited_work":{"arxiv_id":"2505.19434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19434","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cstrack: Enhancing rgb-x track- ing via compact spatiotemporal features.arXiv preprint arXiv:2505.19434","venue":null,"work_id":"0856f3fe-e9fe-47da-9f49-82b3e397edf7","year":null},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2505.19434","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:5e1175f7c6ef0496a74190599394242c6a89af2bf276019f91631ed68eb9417d","observation_id":"d93218e6-6d02-432f-843f-0e7a18ab5ded","resolution":{"observed_at":"2026-05-11T23:16:14.235460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17564","last_updated":"2025-06-28T08:38:59Z","snapshot_observed_at":"2026-07-06T19:22:32.667859Z","submitted_at":"2024-09-26T06:27:15Z","title":"General Compression Framework for Efficient Transformer Object Tracking","version":2},"cited_work":{"arxiv_id":"2409.17564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.17564","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"General compression framework for efficient transformer object tracking.arXiv preprint arXiv:2409.17564, 2024a","venue":null,"work_id":"ab0e98de-e22c-422f-a758-1d8d31d79fee","year":null},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2409.17564","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:8c1501162cf7351272fa84887b739ada302a581099c110612e6b31627c89a232","observation_id":"77631125-e5aa-4e0a-b75a-1af9c8523687","resolution":{"observed_at":"2026-05-11T23:16:14.296555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:2bbb254eded31d1656629f21f68ccb16201b3527c4a6803d603d1cea86674c6a","observation_id":"6c6ac4e8-52b6-41d7-84dd-288da0f8b33a","resolution":{"observed_at":"2026-05-11T23:16:14.271638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12502","last_updated":"2026-04-14T09:27:50Z","snapshot_observed_at":"2026-07-06T23:00:41.835763Z","submitted_at":"2026-04-14T09:27:50Z","title":"SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker","version":1},"cited_work":{"arxiv_id":"2604.12502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12502","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker","venue":"cs.CV","work_id":"e2d4cb28-1d2e-4167-a3ab-e523aeba8f7d","year":2026},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2604.12502","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:e838b6dc2fc06ea4350c2fa1c1f1e1a97953372f448a874efa0c99d3b00ad9b9","observation_id":"b492a5d5-21f9-4d17-92ac-005950b60abb","resolution":{"observed_at":"2026-05-11T23:16:14.308567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17773","last_updated":"2024-11-28T14:51:48Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T03:00:58Z","title":"XTrack: Multimodal Training Boosts RGB-X Video Object Trackers","version":2},"cited_work":{"arxiv_id":"2405.17773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17773","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"P., Van Gool, L., and Timofte, R","venue":null,"work_id":"f6308844-e429-444e-ae4d-7643c2f447b6","year":null},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2405.17773","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:b16b9a5ad4aa7f8d6a432ee3b7111cbdedbd9682f8dec712c21ee260b6d2a784","observation_id":"61716e06-76d8-4bbc-a511-3bf430a64ae8","resolution":{"observed_at":"2026-05-11T23:16:14.322164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05899","last_updated":"2025-07-08T11:40:21Z","snapshot_observed_at":"2026-07-06T21:53:51.299826Z","submitted_at":"2025-07-08T11:40:21Z","title":"What You Have is What You Track: Adaptive and Robust Multimodal Tracking","version":1},"cited_work":{"arxiv_id":"2507.05899","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05899","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What you have is what you track: Adaptive and robust multimodal tracking.arXiv preprint arXiv:2507.05899","venue":null,"work_id":"2201231f-3291-4c2d-a529-24d671e37062","year":null},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2507.05899","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:bfc7330b56ad21dc2502ecb00cf74476a3fa232cfe6434a8191d5004a9e820bf","observation_id":"a76fc86e-3210-41d9-a24c-a27ab7c7956e","resolution":{"observed_at":"2026-05-11T23:16:14.195229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visevent: Reliable object tracking via collaboration of frame and event flows.IEEE Transactions on Cybernetics, 54(3):1997–2010","venue":null,"work_id":"776358fc-51d1-496a-afec-8b5d0df83d63","year":1997},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:10f16267a91d2770e209cfeb79237429d2979ccbd8ad5deb285d1d6d70581498","observation_id":"c2c7e7bb-4a36-4662-85c3-b1365f2b23ac","resolution":{"observed_at":"2026-05-27T00:38:35.016014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:9917f669a99b53dd0067485d74542fa9551f499ae3e813011500c15bc1f909d1","observation_id":"cb63ef5b-b137-4b8a-a350-1ea06c2fc380","resolution":{"observed_at":"2026-05-11T23:16:14.179350Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14949","last_updated":"2022-05-30T09:34:44Z","snapshot_observed_at":"2026-07-06T13:15:21.126555Z","submitted_at":"2022-05-30T09:34:44Z","title":"HiViT: Hierarchical Vision Transformer Meets Masked Image Modeling","version":1},"cited_work":{"arxiv_id":"2205.14949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.14949","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hivit: Hierarchical vision trans- former meets masked image modeling.arXiv preprint arXiv:2205.14949","venue":null,"work_id":"a5b8f1dd-3a30-4608-9415-1a46ef72b1d7","year":null},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2205.14949","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:5239b9d4af7ca5717708d85b93e633b196688677e7a14ab5a4057c355d6b186d","observation_id":"170febd2-3627-485d-9308-9ef77a0bec2e","resolution":{"observed_at":"2026-05-11T23:16:14.223414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02467","last_updated":"2025-01-05T07:28:50Z","snapshot_observed_at":"2026-08-05T01:20:51.385221Z","submitted_at":"2025-01-05T07:28:50Z","title":"DeTrack: In-model Latent Denoising Learning for Visual Object Tracking","version":1},"cited_work":{"arxiv_id":"2501.02467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02467","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detrack: In-model latent denoising learning for visual object tracking.arXiv preprint arXiv:2501.02467, 2025a","venue":null,"work_id":"92106731-140c-4fc6-ae2f-2c539be34a16","year":null},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"cited_paper":"/paper/2501.02467","citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:43ff748290c6b0abded161ead7b3a83d17e88c60151f706a755ec76bd8c43296","observation_id":"4fb6d82d-bcd3-4a13-92df-b32f1d2d57f0","resolution":{"observed_at":"2026-05-11T23:16:14.210308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalization of Meta Merger We further validate the generalization potential of the Meta Merger by testing on anunseenmodality excluded from the training phase","venue":null,"work_id":"e55ee154-4de3-4a3e-b5a9-408c73c1eaf0","year":2024},"citing_paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:49.388949Z"},"links":{"citing_paper":"/paper/2605.03716"},"observation_digest":"sha256:5afdf45744548e784f337e4a6f4b7735952c4668b2fd1ba36b123c36deee6630","observation_id":"b51b04f0-ffeb-47e5-9b99-119f979617a3","resolution":{"observed_at":"2026-05-27T00:38:35.019517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.03716","last_updated":"2026-05-05T13:05:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T00:17:55.254287Z","submitted_at":"2026-05-05T13:05:50Z","title":"Unified Multimodal Visual Tracking with Dual Mixture-of-Experts"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":2},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2605.03716."}