{"as_of":"2026-08-09T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a6b2a96792b3c7ebbe536a702c009b068f2811179cb496c9d5ceaa812d537d6","coverage":[{"denominator":106,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:11:15.127792Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19990/citation-record","integrity":"/paper/2505.19990/integrity","json":"/paper/2505.19990/citation-record.json","paper":"/paper/2505.19990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.671157Z","title":"Tao: A large-scale bench- mark for tracking any object.European Conference on Computer Vision, pages 436–454, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.671157Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c2c728ee36f5046b109410a747ddee315401babb17efd97865ce7c8e3247aa75","observation_id":"b0c84543-f663-451a-b429-6ef9aff5b0e6","resolution":{"observed_at":"2026-08-07T14:11:05.671157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.728102Z","title":"Revisiting neural scaling laws in language and vi- sion.Advances in Neural Information Processing Systems, 35:22300–22312, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.728102Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:891a30fe861ddca956c2c4192c2a14f7900eca41a11c93bf3a31bb03d2d84e7d","observation_id":"325a880c-0327-4032-a1a0-0350fcc62133","resolution":{"observed_at":"2026-08-07T14:11:05.728102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.785966Z","title":"Getting vit in shape: Scal- ing laws for compute-optimal model design.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.785966Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:55efd1275bf11035ff3714a43033c4f7b3bf8ec13afab02ea55189ea9e00da3f","observation_id":"37ab9bb2-c3c5-4aac-9793-43432a617450","resolution":{"observed_at":"2026-08-07T14:11:05.785966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17133","last_updated":"2024-02-13T11:51:07Z","snapshot_observed_at":"2026-07-06T17:09:19.909685Z","submitted_at":"2023-12-28T17:08:11Z","title":"ARTrackV2: Prompting Autoregressive Tracker Where to Look and How to Describe","version":3},"cited_work":{"arxiv_id":"2312.17133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.17133","snapshot_observed_at":"2026-08-07T14:11:17.028369Z","title":"ARTrackV2: Prompting Autoregressive Tracker Where to Look and How to Describe","venue":"cs.CV","work_id":"c30c500b-7821-4dfc-aac4-a252de73f116","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.837761Z"},"links":{"cited_paper":"/paper/2312.17133","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d8245b3d641c17d56699dd49674c40c37cfe76caccc7272f855fb097f16dae7f","observation_id":"ab48a6d1-9b0e-424f-8a3d-5193a37fddb1","resolution":{"observed_at":"2026-08-07T14:11:17.061778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.901251Z","title":"Ar- trackv2: Prompting autoregressive tracker where to look and how to describe","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.901251Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:dc2d80ed1c78c651844814f219f40695bee40a693890bc1eb4629f835e8a1567","observation_id":"85545810-1af6-436f-8d63-a35dea06a219","resolution":{"observed_at":"2026-08-07T14:11:05.901251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:05.961880Z","title":"Fully-convolutional siamese networks for object tracking","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:05.961880Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:0b5a46e50824364ae7a498f2a0254f31ef507e71e4371819a941fae930e891f7","observation_id":"f7775140-9941-4576-bc16-2a3b4380a34f","resolution":{"observed_at":"2026-08-07T14:11:05.961880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.118001Z","title":"Learning discriminative model prediction for tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.118001Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:02305a07f564d964ae0b9c20f570b11ce86fd7bb867dfc15d0b4c5faa2492116","observation_id":"e15b4302-9f8a-449c-9a9e-2588f135665a","resolution":{"observed_at":"2026-08-07T14:11:06.118001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.200784Z","title":"Visual object tracking using adaptive corre- lation filters","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.200784Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:72a12d7d540a51cf8aa94368f58edb56363a75e517d1b07286fc0e7aab09ff2b","observation_id":"8573ed09-0f62-4d10-bf81-c26f0a6df091","resolution":{"observed_at":"2026-08-07T14:11:06.200784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T14:11:06.260989Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.260989Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:32512315437d1efda525442537aba6c6ecdfb5fccc59688699b3b33cf1976c84","observation_id":"6fd7e908-e700-42a6-9460-e172aa2d65c8","resolution":{"observed_at":"2026-08-07T14:11:06.260989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.324897Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.324897Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:13d657511b32281ba967b4e5708ad60ee6567231b64c1187f0e6fd6917b3ee46","observation_id":"14c25b1f-eff0-4316-a75c-d2ad0b5e2a00","resolution":{"observed_at":"2026-08-07T14:11:06.324897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.380660Z","title":"Back- bone is all your need: A simplified architecture for visual object tracking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.380660Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:255ef5bb0139aa190213b42ad9af1f48fec343c36d5acd9d18afcede0284e6f6","observation_id":"e6424aee-b368-4e82-a185-e356dac8ee3d","resolution":{"observed_at":"2026-08-07T14:11:06.380660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.458349Z","title":"Deepdriving: Learning affordance for direct percep- tion in autonomous driving","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.458349Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:98e86542fe83cf77ed4aad4d661f1c164208cbd2b300e708439bae72ec0d8b9a","observation_id":"439e4df4-3cd9-4a57-94c4-53ff4e097bda","resolution":{"observed_at":"2026-08-07T14:11:06.458349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.521868Z","title":"Transformer tracking","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.521868Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:696ef8fcdf0d85cf1fb3e3aa1f00d849f77db32b300b5d0b092bdc438d4e2cff","observation_id":"fc2b4dc0-1c61-441e-b1e8-7de28fd4108c","resolution":{"observed_at":"2026-08-07T14:11:06.521868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.583095Z","title":"Seqtrack: Sequence to sequence learning for vi- sual object tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.583095Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:02533bc0ba010d6e760d56b7d237c6b5c9fdf4bcac59e81202e86e3ce64c4050","observation_id":"2cba22f2-772d-4c8e-a7e9-35e767cb3052","resolution":{"observed_at":"2026-08-07T14:11:06.583095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.656905Z","title":"Siamese box adaptive network for visual tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.656905Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:1006225d5b41dd7c9d49cd377e4cc1babb151e30109861b59fafe93f7246c666","observation_id":"78620551-f482-4e15-877d-f41107e07b0e","resolution":{"observed_at":"2026-08-07T14:11:06.656905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.714740Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.714740Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:3255a95a6fbbbb5da6506a5b5aefb76d98a26272af4dd96c6912494c3cd095c8","observation_id":"e5bddf16-675f-42bd-a6a1-d04291b8d73d","resolution":{"observed_at":"2026-08-07T14:11:06.714740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.837921Z","title":"Mixformer: End-to-end tracking with iterative mixed atten- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.837921Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:89afdaa6b667ac246bcc5354e2aa88c06dfbc2043e1e3d20bcf593d101d84974","observation_id":"73975dcd-ae63-4411-8293-7b88be74023d","resolution":{"observed_at":"2026-08-07T14:11:06.837921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:06.937379Z","title":"Sportsmot: A large multi-object tracking dataset in multiple sports scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:06.937379Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d222bfb4ebf9f726930f2b3ddf74e7dc7a876fcb30ab9dedfa683f7b7db8b9ac","observation_id":"c55e1cdb-79a1-48f1-9990-f69ced688fc8","resolution":{"observed_at":"2026-08-07T14:11:06.937379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.011198Z","title":"Mixformerv2: Efficient fully transformer tracking.Ad- vances in Neural Information Processing Systems, 36,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.011198Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:fc6918ae9708e53ca32b6ddc7e21c8129ed79c77fd677620b82862cab23837e2","observation_id":"ed58ac3a-73dd-4615-8484-8526574bc4e4","resolution":{"observed_at":"2026-08-07T14:11:07.011198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.116721Z","title":"High-performance long- term tracking with meta-updater","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.116721Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:895d9627dee4f37c0a8505300f87d1c0130ac69a11e75b246a5e1fa07c52e54c","observation_id":"828ed16f-3cdc-4a28-8c73-fe5ef0a63682","resolution":{"observed_at":"2026-08-07T14:11:07.116721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.218986Z","title":"Atom: Accurate tracking by overlap maximization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.218986Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:5c4739624c028bb91aef2d9aaa8dca5910798d3dc4569bddd05c3cc2ec89c2d8","observation_id":"d6b075ac-a197-43cd-aa7d-bec7e95d1bba","resolution":{"observed_at":"2026-08-07T14:11:07.218986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.321335Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.321335Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:449e1b56bd8a957c68899e79a0b9bda686b8442c78aa7139f8dd9935f4ceb134","observation_id":"13def0ab-151d-4a2f-b5d0-838ca3d1b0c5","resolution":{"observed_at":"2026-08-07T14:11:07.321335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.09003","last_updated":"2020-03-19T20:08:24Z","snapshot_observed_at":"2026-08-01T23:12:45.187111Z","submitted_at":"2020-03-19T20:08:24Z","title":"MOT20: A benchmark for multi object tracking in crowded scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.09003","snapshot_observed_at":"2026-08-07T14:11:07.390614Z","title":"Mot20: A benchmark for multi object tracking in crowded scenes.arXiv preprint arXiv:2003.09003, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.390614Z"},"links":{"cited_paper":"/paper/2003.09003","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:e8a2cff3df27d33865bc445e2f56b622347a6e2d5346885dc926806fde58642e","observation_id":"fb07304c-61c7-4a05-81e3-b8440489d16c","resolution":{"observed_at":"2026-08-07T14:11:07.390614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.477722Z","title":"Motchallenge: A benchmark for single- camera multiple target tracking.International Journal of Computer Vision, 129:845–881, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.477722Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:4e0caa71b000014ae716b9638e72e0b1676257f9dd1fb636312fb5c5d3b01ded","observation_id":"7b4bcecd-2b5d-4e3f-a612-7e12e67ed092","resolution":{"observed_at":"2026-08-07T14:11:07.477722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.551199Z","title":"Mose: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.551199Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:0dce4ab772bfcc4fd40a0d04bf4517a29878ba97f179a05c1619a1e30192661f","observation_id":"f37dddb6-f352-4493-bd69-e456f5a3c4a5","resolution":{"observed_at":"2026-08-07T14:11:07.551199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T14:11:07.621557Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.621557Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:7a4ec8dacbfb13d1ca6cc821abda9a3091d24aa215d7d02b513b1d9a382b4cff","observation_id":"b17745da-39e5-40f1-960f-88236e737404","resolution":{"observed_at":"2026-08-07T14:11:07.621557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.710058Z","title":"The unmanned aerial vehicle benchmark: Ob- ject detection and tracking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.710058Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6c854beb51e4e81f6ceafb51551231504958d764876565837c86748c4e4f7f91","observation_id":"1f0e7ccf-6ad9-4a62-a1bb-3148bc3869a1","resolution":{"observed_at":"2026-08-07T14:11:07.710058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.783874Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.783874Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:b9d01b59d20ca386e66ce83119d65a3fa9cbc535523b47f9b491dca4174d6bf0","observation_id":"3fa62bd5-7f55-4de5-b289-1ac1368906f4","resolution":{"observed_at":"2026-08-07T14:11:07.783874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:07.904001Z","title":"Data determines distributional robustness in contrastive lan- guage image pre-training (clip)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:07.904001Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:63957d9c843344c5443e29dff3fab12548a35a80a76291d48778b873658564e2","observation_id":"39aabe07-19c8-4993-8cc7-4629f148d016","resolution":{"observed_at":"2026-08-07T14:11:07.904001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18835","last_updated":"2023-11-30T18:59:51Z","snapshot_observed_at":"2026-07-06T16:55:13.127567Z","submitted_at":"2023-11-30T18:59:51Z","title":"InstructSeq: Unifying Vision Tasks with Instruction-conditioned Multi-modal Sequence Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18835","snapshot_observed_at":"2026-08-07T14:11:08.003956Z","title":"Instructseq: Unifying vision tasks with instruction- conditioned multi-modal sequence generation.arXiv preprint arXiv:2311.18835, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.003956Z"},"links":{"cited_paper":"/paper/2311.18835","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:5be84887c32e9b210e2d1a1a0517d5737c74f74a4dd67b1a9c569f08376249d0","observation_id":"e1f29e1b-1d99-4539-ab8e-1bd3c5a34a20","resolution":{"observed_at":"2026-08-07T14:11:08.003956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.655798Z","title":"Gener- alized relation modeling for transformer tracking","venue":null,"work_id":"5cf594e5-4e5c-4557-bbf6-41b920c32541","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.074895Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:800015e0df59d9785f7c8892b987e3f1d39ce7d382d5fe7bef1958f37cbb3947","observation_id":"463ce8bb-58c2-4e39-970e-adcaf90e2ffe","resolution":{"observed_at":"2026-08-07T14:11:27.809220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.507864Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"57c1cbe6-6d34-4414-8511-4f6db2dd7225","year":2012},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.178079Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c167f6c0cc225328ca58202090c2c709dd122de349c201842b09bed830a5e34b","observation_id":"5880ff38-302d-471a-a60d-699ebc55da1f","resolution":{"observed_at":"2026-08-07T14:11:27.565772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.381359Z","title":"Separable self and mixed attention transformers for efficient object track- ing","venue":null,"work_id":"cfc65e83-2a1d-4e40-9e1f-e6aa77488120","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.263792Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:9c1be0999016acbc9f9d8953a7af814ee38cff2199fc81b32a12358c68d758c7","observation_id":"1ace0fba-e6e9-4e6b-b5f3-ae181f8d3c4b","resolution":{"observed_at":"2026-08-07T14:11:27.444923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:27.103346Z","title":"High-speed tracking with kernelized correlation filters.IEEE transactions on pattern analysis and machine intelligence, 37(3):583–596, 2014","venue":null,"work_id":"c2e92c8f-3b66-4a7e-bde5-99930b9e464e","year":2014},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.367001Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:13bb1cf28b7e0cf4f2d124fba5ab57dc94e9207f9c055d14f5ba06b05f455de4","observation_id":"69491299-1226-48a1-af28-76e63a5ec0a2","resolution":{"observed_at":"2026-08-07T14:11:27.244702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-07T14:11:08.467790Z","title":"Deep learn- ing scaling is predictable, empirically.arXiv preprint arXiv:1712.00409, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.467790Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:7f6afb79d98d43e02910ca13d12f3eaa12e09c1489871796481a4c622c904ecf","observation_id":"66be9cc3-e7fd-4dd5-8e72-e99dd2e25253","resolution":{"observed_at":"2026-08-07T14:11:08.467790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T14:11:08.548933Z","title":"Training compute-optimal large language mod- els.arXiv preprint arXiv:2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.548933Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:820819d49d052d59d3127fdf25fce39d4bc60dc3f25099750ed2dcd0ccb0d225","observation_id":"f1020365-bcba-4fcf-a0c4-d6101b8a283c","resolution":{"observed_at":"2026-08-07T14:11:08.548933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-07T14:11:08.621260Z","title":"Worldsense: Evaluating real-world omni- modal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.621260Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:8d6b90e176eb212741983ce5ca21009c0f940cb157852f06ac7913c6a84121ae","observation_id":"1ec78105-c4c0-4cd0-843f-4b62eb2acb1b","resolution":{"observed_at":"2026-08-07T14:11:08.621260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17564","last_updated":"2025-06-28T08:38:59Z","snapshot_observed_at":"2026-08-08T01:06:51.911147Z","submitted_at":"2024-09-26T06:27:15Z","title":"General Compression Framework for Efficient Transformer Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17564","snapshot_observed_at":"2026-08-07T14:11:08.722019Z","title":"General compression framework for efficient transformer object tracking.arXiv preprint arXiv:2409.17564, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.722019Z"},"links":{"cited_paper":"/paper/2409.17564","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:35cbeec9222f0c12bd66e1d87cab9391d74f8e1bb4ca617967b28c1dd17d4b7a","observation_id":"47caee20-2549-495e-9791-e205cde956ec","resolution":{"observed_at":"2026-08-07T14:11:08.722019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.896268Z","title":"Onetracker: Unifying visual object tracking with foundation models and efficient tuning","venue":null,"work_id":"fba352f0-5a6a-46eb-9bee-0bd1f44c5560","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.796852Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:1919cd41d88ec1fd925be184941ff907e705323e31a22f510fc5ae2f68863950","observation_id":"99a4104d-73c1-473a-9175-7061c8e5b8a7","resolution":{"observed_at":"2026-08-07T14:11:26.994050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.790948Z","title":"Global instance tracking: Locating target more like hu- mans.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(1):576–592, 2022","venue":null,"work_id":"e7e204e6-f723-4ff8-b863-8fd19b6c25aa","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.843394Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:3864d66e015bbfde00be55a5afa03a4987587e1c406ab36aa40eea1903378931","observation_id":"2b0b0e74-f144-49ce-a464-8acc58e4c7e5","resolution":{"observed_at":"2026-08-07T14:11:26.835598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.667075Z","title":"Got-10k: A large high-diversity benchmark for generic object track- ing in the wild.IEEE transactions on pattern analysis and machine intelligence, 43(5):1562–1577, 2019","venue":null,"work_id":"ebf806f1-bd9b-4535-b8cf-987d11ba3d7b","year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.886428Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:41ed69c1afd0b24a7d08d27bfa82b4cfcc50a890c3f85bfa7e2511d8da59a1b6","observation_id":"fac914fa-d0d4-4ad5-9034-3319b0b77551","resolution":{"observed_at":"2026-08-07T14:11:26.718740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.548322Z","title":"Automatic foveation for video compression us- ing a neurobiological model of visual attention.IEEE trans- actions on image processing, 13(10):1304–1318, 2004","venue":null,"work_id":"f5ee2122-b77a-4f46-b83c-fac8ef43ac30","year":2004},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.937316Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:69dfcfd4ed0533a171f0721501ca684886ac0a8477af80e06cf6dfe13316ac16","observation_id":"b5e034d3-d5fd-4746-a1cd-fcbd94eb42eb","resolution":{"observed_at":"2026-08-07T14:11:26.592445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.404701Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"206b7af6-8796-4d96-9e5b-04a50970d646","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.983535Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:7f6d050e285df2b9a51c73ac81a7140881a520ec9706702b7ac63abfcd6d005c","observation_id":"f4febe26-9316-4bcf-b31e-03cca17cfc57","resolution":{"observed_at":"2026-08-07T14:11:26.486789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:26.256545Z","title":"Exploring lightweight hierarchical vision transformers for efficient visual tracking","venue":null,"work_id":"4858e066-25f2-4dd6-9ca1-cc937a10a134","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.039466Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:b48c1cf88325b9b559ba29cc71743acc814db5c6f095e3210321eeeea6a362ec","observation_id":"ca0d12e8-a484-4a23-9ffe-55126cf7b70f","resolution":{"observed_at":"2026-08-07T14:11:26.329962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:11:09.098348Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.098348Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:da0f9354e95f10f60b7d56bff135f7fce4fccffb3f61e9908a2318ecc436efcb","observation_id":"388594c3-ce0b-45fd-acc6-c1d918cc4409","resolution":{"observed_at":"2026-08-07T14:11:09.098348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:25.878698Z","title":"Big transfer (bit): General visual representation learning","venue":null,"work_id":"47082152-51a8-436e-82b2-a6d43c856659","year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.143091Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:eaff1587e061e182e67927825ded3e91eb81930d00b69faecd3e9877af3d04f2","observation_id":"7a5896fd-6ce1-4d4d-994d-f5af05601251","resolution":{"observed_at":"2026-08-07T14:11:26.199747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:09.215204Z","title":"High performance visual tracking with siamese region pro- posal network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.215204Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:54ea77e0c4a6d3424f3110a7aa3a3c0cc8be6b3c35a5db8db7f2dc65d35b4070","observation_id":"a8422727-7309-4d8c-af1b-1c51e224e583","resolution":{"observed_at":"2026-08-07T14:11:09.215204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:24.495555Z","title":"Siamrpn++: Evolution of siamese vi- sual tracking with very deep networks","venue":null,"work_id":"2d011e3b-b33f-4de0-b73c-5c54ad5d6212","year":2019},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.281106Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:817feacf801402f4216ffc5e5bb23d8a994b311953712769d50c8f1c4d11c89e","observation_id":"1de2b632-910a-44b8-b048-7232cf44bfd4","resolution":{"observed_at":"2026-08-07T14:11:25.457948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:22.405571Z","title":"Lasher: A large-scale high-diversity benchmark for RGBT tracking.IEEE Trans- actions on Image Processing, 31:392–404, 2021","venue":null,"work_id":"e542071b-a069-427c-a7c3-6b58613810bd","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.324431Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:f830031aa808002371031af69d6542c2a212a6c40682a99e23c501d08c25cb8e","observation_id":"2ab73e29-2745-4420-b7be-6cd9c38b8cda","resolution":{"observed_at":"2026-08-07T14:11:22.975617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:22.155209Z","title":"Tracking meets lora: Faster training, larger model, stronger performance","venue":null,"work_id":"48667459-ee11-43a9-b1a2-75facdd66585","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.365264Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:43e2636c93bc6d4691a46dd3dbdbae78d4fd46956c3f43e9cde9961b0ca5f3c3","observation_id":"581a6ceb-97a1-49f4-a78f-96f42e459432","resolution":{"observed_at":"2026-08-07T14:11:22.221739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.979942Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"e519db65-87af-4bc0-934d-70e9f75ea636","year":2014},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.389735Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:de94077b5016c38896ea01d5c98d18908435f06dc19088a3f965393cc0cd0acf","observation_id":"9972f88c-c76e-4bd1-86ce-ec799893529c","resolution":{"observed_at":"2026-08-07T14:11:22.063708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02054","last_updated":"2024-11-30T01:55:11Z","snapshot_observed_at":"2026-08-05T17:47:46.735616Z","submitted_at":"2024-02-03T06:17:21Z","title":"Towards Neural Scaling Laws on Graphs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02054","snapshot_observed_at":"2026-08-07T14:11:09.438355Z","title":"Neural scaling laws on graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.438355Z"},"links":{"cited_paper":"/paper/2402.02054","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:357ff4fb0e270db11702f64c74e37275f1de35878acc5ccbf273c63e4383b4db","observation_id":"6ad1204f-04b0-4268-bae1-4bf0d17431e3","resolution":{"observed_at":"2026-08-07T14:11:09.438355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T14:11:09.535348Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.535348Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:53d277b4597597abcbcaf153e0cd2c1278a9024b59db4205812a3460ae3ce228","observation_id":"e81e1570-30a4-4f3c-84e8-668d2b27ba6a","resolution":{"observed_at":"2026-08-07T14:11:09.535348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11795","last_updated":"2025-04-06T18:52:08Z","snapshot_observed_at":"2026-08-04T05:24:14.383678Z","submitted_at":"2024-08-21T17:36:37Z","title":"EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11795","snapshot_observed_at":"2026-08-07T14:11:09.592996Z","title":"Ee-mllm: A data-efficient and compute- efficient multimodal large language model.arXiv preprint arXiv:2408.11795, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.592996Z"},"links":{"cited_paper":"/paper/2408.11795","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:970ee55642a27d1cb7347e6ba7ecb8557b68ed8ad6f6a1e25c66cefb8b878eb0","observation_id":"008b2fb9-ad13-4f06-bd4a-2096d909047c","resolution":{"observed_at":"2026-08-07T14:11:09.592996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.818105Z","title":"Be- yond sot: Tracking multiple generic objects at once","venue":null,"work_id":"bed62ca7-d9ed-44b5-a477-6c52ce3422ec","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.657828Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:00ae428fe488a2e1faaeecb365c2bad631c4a32add3d4943bec78aa900dc4e96","observation_id":"0a50eaea-c597-4f47-945a-712fd0fb5a8d","resolution":{"observed_at":"2026-08-07T14:11:21.889954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.00831","last_updated":"2016-05-03T23:55:38Z","snapshot_observed_at":"2026-08-03T05:59:06.882015Z","submitted_at":"2016-03-02T19:07:56Z","title":"MOT16: A Benchmark for Multi-Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.00831","snapshot_observed_at":"2026-08-07T14:11:09.753966Z","title":"Mot16: A benchmark for multi-object tracking.arXiv preprint arXiv:1603.00831, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.753966Z"},"links":{"cited_paper":"/paper/1603.00831","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d198f681af21e13f58b0e7fad9315474c477de6d2ceb335355a044790d0d9f81","observation_id":"8b0543d0-4feb-4d10-9dc4-09564cd5b4c7","resolution":{"observed_at":"2026-08-07T14:11:09.753966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.670997Z","title":"Scaling open-vocabulary object detection.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"049068d5-32f8-433f-b4e6-96c221a8ca0a","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.811009Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:1146ed624dcafe1f72b0a0fc96357898c5d4b707b4be5414f8a6ec418ea0e04f","observation_id":"25982780-d3af-4014-b664-dbbb811fc100","resolution":{"observed_at":"2026-08-07T14:11:21.750740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.526085Z","title":"A benchmark and simulator for uav tracking","venue":null,"work_id":"915b81af-6703-404c-ad02-c335a105b506","year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.854510Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d27d388eade2931f11140d94acdea1989d5a13f953d12f601626b6c2b3dce96e","observation_id":"3809393e-ff96-415e-9f6b-6805f533df05","resolution":{"observed_at":"2026-08-07T14:11:21.591079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.380416Z","title":"Trackingnet: A large-scale dataset and benchmark for object tracking in the wild","venue":null,"work_id":"b27004ba-8b12-4cd3-aafa-505a102cf203","year":2018},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:09.946386Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:fac82ab3c82d29497d061bf1a37f7dc5a5dc7a463d66ae96df73477df7427260","observation_id":"582ce037-bb9f-4bf9-87c3-4428f3280a54","resolution":{"observed_at":"2026-08-07T14:11:21.460727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.220707Z","title":"Learning multi- domain convolutional neural networks for visual tracking","venue":null,"work_id":"25751e0d-8919-4958-bbe1-88bad873f2f8","year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.018907Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6514b4ed35b1a8e67d83812def835ccf9183ede2512bf7bf457f7364eacbecc3","observation_id":"3a890487-6c62-44a3-ac54-946f30bdb9b6","resolution":{"observed_at":"2026-08-07T14:11:21.298148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06888","last_updated":"2022-08-14T17:49:37Z","snapshot_observed_at":"2026-07-06T13:41:45.515145Z","submitted_at":"2022-08-14T17:49:37Z","title":"AVisT: A Benchmark for Visual Object Tracking in Adverse Visibility","version":1},"cited_work":{"arxiv_id":"2208.06888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.06888","snapshot_observed_at":"2026-08-07T14:11:16.666649Z","title":"AVisT: A Benchmark for Visual Object Tracking in Adverse Visibility","venue":"cs.CV","work_id":"6a5439fa-e160-4c03-aac2-049413dabd00","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.105328Z"},"links":{"cited_paper":"/paper/2208.06888","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:294434231e0d746956058960a81d8ad2231e22eb86a4212a791fe37682073a51","observation_id":"b9a31104-6462-43b8-9139-e377714e8f41","resolution":{"observed_at":"2026-08-07T14:11:16.732957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.204342Z","title":"Combined scal- ing for zero-shot transfer learning.Neurocomputing, 555: 126658, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.204342Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:49535ef55dd2ea66fcb89aa2836e9132efc03f9223ce40d8cb5752716efbbbcb","observation_id":"820c7a6c-6bf4-49c3-8c1c-d08e7c4c1f41","resolution":{"observed_at":"2026-08-07T14:11:10.204342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:21.061014Z","title":"Occluded video instance segmentation: A benchmark.International Journal of Computer Vision, 130 (8):2022–2039, 2022","venue":null,"work_id":"58863b7c-5d32-4b72-b918-d94d0ba996d0","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.323451Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c93a593c904612b953e094d3c63ec2deed211a6c32aafb14db3409e03bd47b6a","observation_id":"d8104714-1b02-484f-b5b5-6384f289b449","resolution":{"observed_at":"2026-08-07T14:11:21.116546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.462504Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.462504Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:eeba242f95bf3b67a169043b14a7979b6a8f9c968e095dfd9c8d26e1fadd3a3c","observation_id":"7d656761-af20-4509-af35-642ee983bdf1","resolution":{"observed_at":"2026-08-07T14:11:10.462504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T14:11:10.538543Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.538543Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c95032bf2395f1172c7f3230c85fcf7a0978856a43c6d359a4180b1b2359490d","observation_id":"250477b0-ced0-4fc4-89ee-bb40a79f47b2","resolution":{"observed_at":"2026-08-07T14:11:10.538543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.933723Z","title":"Scaling vision with sparse mix- ture of experts.Advances in Neural Information Processing Systems, 34:8583–8595, 2021","venue":null,"work_id":"b1a83068-84fd-4a5c-a889-45490d260d88","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.650455Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:ca837d82c5310ae8d8e8680067cd3a3443faa6ca578a224c841d1fc7659c303e","observation_id":"67acdf1f-c9b4-48b8-904e-2ac3ee8142ca","resolution":{"observed_at":"2026-08-07T14:11:20.982040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.730778Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.730778Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:3a19ff551b34a5e2e64943a3ba3c98f11ec905a5a3cad8b41ef6651e720b5149","observation_id":"833b0817-3c99-458a-b9b4-74c64dfa6a58","resolution":{"observed_at":"2026-08-07T14:11:10.730778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.768862Z","title":"Hoot: Heavy occlusions in object tracking benchmark","venue":null,"work_id":"f8c2310e-3230-4d99-887b-bdab4cab1266","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.881836Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:bbf255039c446963147eab98316cea4a8ba5561e46400e85be118fad464691d5","observation_id":"351099dd-0616-4ff4-b9b6-75a3dfb30acd","resolution":{"observed_at":"2026-08-07T14:11:20.835727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:10.954145Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:10.954145Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d457f93086f6275439652b538e9f77c02100b8df5ee7cfcb5638c837a29de32a","observation_id":"7e24302c-080a-4a48-8037-34dcb7315ee6","resolution":{"observed_at":"2026-08-07T14:11:10.954145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.595517Z","title":"Dancetrack: Multi-object track- ing in uniform appearance and diverse motion","venue":null,"work_id":"fff51fa9-4bcf-484c-9dcc-e69a50338670","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.067310Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:45cd075c34397f633bfe360bdaa575ecd06afe2e855efb6946fb19692621b1df","observation_id":"dd4e06d8-03c6-4169-a8a2-451fc002c34c","resolution":{"observed_at":"2026-08-07T14:11:20.672675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-07T14:11:11.182755Z","title":"Scale ef- ficiently: Insights from pre-training and fine-tuning trans- formers.arXiv preprint arXiv:2109.10686, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.182755Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:dee3c79e3ab3497a3324af1dd1f00f4af90ce71b1c014c6d2cb49f2220de6cd7","observation_id":"61d5f9ca-7202-40c5-8fdd-4c14bb08c6b2","resolution":{"observed_at":"2026-08-07T14:11:11.182755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.412544Z","title":"Robust and ef- ficient foreground analysis for real-time video surveillance","venue":null,"work_id":"327c92d8-ac25-4211-824d-871a29c30602","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.312057Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:9a8f94420e07e35083c89f1fe4b1037ee2e6854dfda8ba027ab2eb7cf82c94a4","observation_id":"04ee4c0c-f4bc-465b-a931-57df3a702f89","resolution":{"observed_at":"2026-08-07T14:11:20.514123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:11:11.428186Z","title":"Llama: Open and efficient foundation language mod- els.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.428186Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:6bd25a7a9152ae97a178ca6f36824b31795d9f750c6ea0698b0b79f1549db321","observation_id":"beba9e49-fc01-4502-b104-362ddd37f498","resolution":{"observed_at":"2026-08-07T14:11:11.428186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.241548Z","title":"Image captioners are scalable vision learners too.Advances in Neural Infor- mation Processing Systems, 36, 2024","venue":null,"work_id":"6d7cad22-74a5-4154-a49f-a19ccad66da8","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.528673Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:540ec4d5d67aebd8b06f5be70c466e7d429797930f3eae7cd35c9f0fe1125587","observation_id":"028d4226-7067-4f4b-84f1-3591e4b933ca","resolution":{"observed_at":"2026-08-07T14:11:20.319634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:20.104278Z","title":"Siam r-cnn: Visual tracking by re-detection","venue":null,"work_id":"de7b92c0-e85c-4cf0-bf05-452f7b0b6660","year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.670796Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:498331ceda0c13df8bd8795a3200081988430b294b6395530b249812877cd34f","observation_id":"a6fa363b-2751-4629-8a16-1f008a343d4b","resolution":{"observed_at":"2026-08-07T14:11:20.162266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.922672Z","title":"Unidentified video objects: A benchmark for dense, open- world segmentation","venue":null,"work_id":"8917837d-2663-4c1b-a419-df818581ae0a","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.811255Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:b70be0a6c213fdb75b347a66bb74695390e851a13e539ff326cdb0ef3d391965","observation_id":"5db176de-e473-4904-b05c-fc2ce3ab9c32","resolution":{"observed_at":"2026-08-07T14:11:20.009861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05015","last_updated":"2023-09-21T06:50:36Z","snapshot_observed_at":"2026-08-06T15:43:00.409387Z","submitted_at":"2021-08-11T03:55:12Z","title":"VisEvent: Reliable Object Tracking via Collaboration of Frame and Event Flows","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05015","snapshot_observed_at":"2026-08-07T14:11:11.960802Z","title":"Vi- sevent: Reliable object tracking via collaboration of frame and event flows.arXiv preprint arXiv:2108.05015, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.960802Z"},"links":{"cited_paper":"/paper/2108.05015","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d4b19c79b1c26e39325ab36021fe1706aa3b5f2f7179a493306dcb50e12bb839","observation_id":"a2341e73-f97f-4bd6-aade-16a9cdea6a61","resolution":{"observed_at":"2026-08-07T14:11:11.960802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.750125Z","title":"Towards more flexi- ble and accurate object tracking with natural language: Al- gorithms and benchmark","venue":null,"work_id":"a708103d-0ff3-4496-97ad-163da1b1e888","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.120700Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:08a12fb0f109687a391f87b99002fcda1753493cc5ff27b04a10c779bf6eb297","observation_id":"d6ca3a14-467f-4b50-a6a6-cec5e6550884","resolution":{"observed_at":"2026-08-07T14:11:19.841374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.600353Z","title":"Autoregressive visual tracking","venue":null,"work_id":"8c82dbf5-e964-4ae6-aa87-7fa654ebf7e0","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.216817Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:31e6f8cc8d43b8891371b61c2e2bd9c7818373731de51b474458a7867c1fd309","observation_id":"89991292-e120-4337-90ba-638a77bb50c4","resolution":{"observed_at":"2026-08-07T14:11:19.659956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.408643Z","title":"Online ob- ject tracking: A benchmark","venue":null,"work_id":"40e743d9-ea9b-4138-8ea5-2e6a34bc607d","year":2013},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.354364Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:ef6503fe98628f6a841bf2495c89cd14b88afb02615b70870be0ecf8461a07be","observation_id":"1aeb69b1-99c8-4d26-b969-a360435423ab","resolution":{"observed_at":"2026-08-07T14:11:19.484663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10700","last_updated":"2024-08-20T09:57:13Z","snapshot_observed_at":"2026-08-07T21:21:54.417483Z","submitted_at":"2024-08-20T09:57:13Z","title":"AnyGraph: Graph Foundation Model in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10700","snapshot_observed_at":"2026-08-07T14:11:12.458637Z","title":"Anygraph: Graph founda- tion model in the wild.arXiv preprint arXiv:2408.10700,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.458637Z"},"links":{"cited_paper":"/paper/2408.10700","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:a0a401129f4afbdadac8334086768788e0d3ae4ee84f7a8f4e80398acf806d8c","observation_id":"b5d00a26-edf3-462e-a609-01423de1939e","resolution":{"observed_at":"2026-08-07T14:11:12.458637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.246031Z","title":"Attribute-based progressive fusion network for RGBT tracking","venue":null,"work_id":"0617e56b-8bdd-4644-8072-06225fde45cd","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.574632Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:7f5b4c49a190349ec6fc01ed8f95b3066afc60a6af092291b94696ef77981549","observation_id":"5ff27371-0898-4021-810d-4951296920fc","resolution":{"observed_at":"2026-08-07T14:11:19.317940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16404","last_updated":"2025-01-27T09:10:06Z","snapshot_observed_at":"2026-08-09T08:41:33.174900Z","submitted_at":"2025-01-27T09:10:06Z","title":"DynaPrompt: Dynamic Test-Time Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16404","snapshot_observed_at":"2026-08-07T14:11:12.691354Z","title":"Dynaprompt: Dynamic test-time prompt tuning.arXiv preprint arXiv:2501.16404, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.691354Z"},"links":{"cited_paper":"/paper/2501.16404","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:3bca4c312eeb85e0b9170861e6e28a312fe8955ff692b5fc58c3f9d01b81e8fc","observation_id":"dc880ee5-80cb-4f2b-94a3-4dd6e096e861","resolution":{"observed_at":"2026-08-07T14:11:12.691354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:19.100303Z","title":"On data scaling in masked image modeling","venue":null,"work_id":"9cccf126-8d46-4999-a623-ebdd1559260a","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.806476Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:d90400f87f22714af34b3c3a3854568233a5316f72fc220740fac6f8f70010cc","observation_id":"41e4dccc-e382-4997-9bd6-477808365a31","resolution":{"observed_at":"2026-08-07T14:11:19.164676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.953489Z","title":"Multi- ple human tracking based on multi-view upper-body de- tection and discriminative learning","venue":null,"work_id":"79b0403d-7a35-4162-8644-eaf9d23ca825","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:12.956635Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:dd85960c4daff37fc465a6641973b1afc6eb28111cbdfbabad45c3819df3b930","observation_id":"f48876ef-0884-458a-b7fe-f1bf83b4f35a","resolution":{"observed_at":"2026-08-07T14:11:19.027097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.807406Z","title":"Learning spatio-temporal transformer for vi- sual tracking","venue":null,"work_id":"b50169f4-2d86-42c7-9014-287ca7e642ef","year":null},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.041797Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:a91209ca1996fd330eb0aa9dd9d6cb89da249f9045cac2aaea6bfe6471647893","observation_id":"8ff38503-aaf1-4417-ae37-7975eeb39966","resolution":{"observed_at":"2026-08-07T14:11:18.869743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.669753Z","title":"Depthtrack: Un- veiling the power of RGBD tracking","venue":null,"work_id":"e2fa990b-ebda-49db-b6c0-70a11905a56a","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.126007Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:dff9715a0d41e1d766ee12048a40d5e1edf0e22dfc829b942bd143141b55c230","observation_id":"30394d7d-6492-4c32-bda4-09fb85670623","resolution":{"observed_at":"2026-08-07T14:11:18.732897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.505754Z","title":"Depthtrack: Un- veiling the power of rgbd tracking","venue":null,"work_id":"9682d679-a542-4563-a05b-caecb1e68890","year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.215773Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:ea192eff1a6552666886956066f57ca71cc6748e9e54e2b9d1d43ce7320fa48f","observation_id":"31830219-47b8-4dab-b1ac-630953df496f","resolution":{"observed_at":"2026-08-07T14:11:18.581390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19435","last_updated":"2025-02-15T16:01:36Z","snapshot_observed_at":"2026-08-06T05:38:31.927956Z","submitted_at":"2024-06-27T17:59:49Z","title":"A Sanity Check for AI-generated Image Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19435","snapshot_observed_at":"2026-08-07T14:11:13.416233Z","title":"A sanity check for ai-generated image detection.arXiv preprint arXiv:2406.19435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.416233Z"},"links":{"cited_paper":"/paper/2406.19435","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:0fea784cf0af4a194a2b872d30f96ce95b5fa6ce5ede62742fda009d7bad8e7f","observation_id":"c7fb0d3d-5705-4dfe-ac00-9f7ef9b4cb84","resolution":{"observed_at":"2026-08-07T14:11:13.416233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.316558Z","title":"Panovos: Bridging non-panoramic and panoramic views with trans- former for video segmentation","venue":null,"work_id":"10acd9ad-ef8d-4cd4-ba6a-956977ab161a","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.601820Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c2b74408a49b37dc468485a7a61e9a985c0fd7e0337c89da2fa3d3fb3f7151bc","observation_id":"30519972-212d-4ded-b247-c0a446c5df05","resolution":{"observed_at":"2026-08-07T14:11:18.391038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.173735Z","title":"Referred by multi-modality: A unified tem- poral transformer for video object segmentation","venue":null,"work_id":"cd00dfa5-4fe5-41ed-b2bc-1f07a78d0aa2","year":2024},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.726872Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:dd111dab7729bdfe60b5a81c4bf7286cc8ed2bfb25d16c3b45066db9a66104a4","observation_id":"45c86d4c-d730-48bd-b1c3-9f836b8df932","resolution":{"observed_at":"2026-08-07T14:11:18.239241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:13.877323Z","title":"Crosslmm: Decoupling long video sequences from lmms via dual cross-attention mechanisms.arXiv preprint arXiv:2505.17020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:13.877323Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:079ab005cb14a5b2effdef50b8394f3cfd33a0f3f282f6169eee796dbadcc6b5","observation_id":"4a0582bd-6854-4368-9832-49a679522113","resolution":{"observed_at":"2026-08-07T14:11:13.877323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:18.063266Z","title":"Prompting for multi-modal tracking","venue":null,"work_id":"2bc25bdf-00e4-44ac-8fea-63b3b133e25f","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.048167Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:b8b4fc691d7195e119937381c6fd4653350228f1694c9632bed3487d1abbb5e3","observation_id":"75c35112-90a3-4fa0-8d4c-4451f91033f1","resolution":{"observed_at":"2026-08-07T14:11:18.123367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.918647Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework","venue":null,"work_id":"10d55eb9-b184-4a21-b21c-75eaaf02a73e","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.193531Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:061cbfa311f52c94fb845c8aadbf4a6b8c7dca1a7dc250dbdfb4050e680805f8","observation_id":"299446c9-7081-4843-934a-abec4bb631ae","resolution":{"observed_at":"2026-08-07T14:11:17.980467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T14:11:14.323400Z","title":"Coca: Con- trastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.323400Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:f26289c19af6a0b04837ef4caae402e3bbf6b357c8600cf228ef754a73afe0c4","observation_id":"81ed8623-a944-4ff3-83d6-d8f8973908be","resolution":{"observed_at":"2026-08-07T14:11:14.323400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.777915Z","title":"Scaling vision transformers","venue":null,"work_id":"e6f381fa-5a52-456f-93af-5d22ae859f4d","year":2022},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.461770Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:4494cdb11f8d552f005412a964801252b1c2d851ad3eb9d7f351f0695598e065","observation_id":"b4bfb68e-5c40-47ab-b39a-af0d8bc56c05","resolution":{"observed_at":"2026-08-07T14:11:17.847892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.663818Z","title":"Instance- level segmentation for autonomous driving with deep densely connected mrfs","venue":null,"work_id":"90b76a2c-e495-4df1-acbd-9407f27edb8a","year":2016},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.589844Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:26e6311530f807c9d7527752bc6fcaeed3f7e96d7d42d0302c9c1173ea621be0","observation_id":"8dc40d3c-e89a-4740-9ab4-fb2c3f51062b","resolution":{"observed_at":"2026-08-07T14:11:17.707588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.497983Z","title":"Ocean: Object-aware anchor-free tracking","venue":null,"work_id":"5ae518db-40fd-4d6c-8b05-be03857d1d34","year":2020},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.781227Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:c63356677536bfe3de38acc2d843ad34e637ebf79657d819892c1296471c6984","observation_id":"20975c95-2d98-461f-b3b7-9ace2f27d3a8","resolution":{"observed_at":"2026-08-07T14:11:17.576605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:17.373863Z","title":"Reading rele- vant feature from global representation memory for visual object tracking.Advances in Neural Information Process- ing Systems, 36:10814–10827, 2023","venue":null,"work_id":"89282cd6-1003-458d-b66f-54dd432d966c","year":2023},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:14.974228Z"},"links":{"citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:441569a71c07f429caf2dae42623188fd9e75e1c13a2ea07d51abb1aaa6cf497","observation_id":"b645f6a8-82c4-4e98-a902-ca526d8c78ce","resolution":{"observed_at":"2026-08-07T14:11:17.431236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02467","last_updated":"2025-01-05T07:28:50Z","snapshot_observed_at":"2026-08-07T00:12:51.933932Z","submitted_at":"2025-01-05T07:28:50Z","title":"DeTrack: In-model Latent Denoising Learning for Visual Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02467","snapshot_observed_at":"2026-08-07T14:11:15.127792Z","title":"Detrack: In-model latent denoising learning for visual object track- ing.arXiv preprint arXiv:2501.02467, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:15.127792Z"},"links":{"cited_paper":"/paper/2501.02467","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:203072abe0a231fb05b8eb6e30274a5d3c4948c1b80a832494023610fcd108ac","observation_id":"1a8f47a5-92dd-4196-baa0-52bace9ec2c0","resolution":{"observed_at":"2026-08-07T14:11:15.127792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":106},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 106 outbound references and 0 inbound Pith citation observations for arXiv:2505.19990."}