{"as_of":"2026-08-10T02:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00d04268bb1e09865baa42b9ec84fb729fa98de90ccffd9627eff851bf9922b0","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:21:08.038670Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:20:54.642591Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:24:21.277633Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"cited_work":{"arxiv_id":"2507.00454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00454","snapshot_observed_at":"2026-06-30T07:24:21.277633Z","title":"Atstrack: Enhancing visual-language tracking by aligning temporal and spatial scales,","venue":null,"work_id":"b2739ed2-39dc-4a93-bcf1-d56b5ebbd00e","year":2025},"citing_paper":{"arxiv_id":"2606.29357","last_updated":"2026-06-28T12:12:18Z","snapshot_observed_at":"2026-07-07T00:03:21.717191Z","submitted_at":"2026-06-28T12:12:18Z","title":"Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T07:20:54.642591Z"},"links":{"cited_paper":"/paper/2507.00454","citing_paper":"/paper/2606.29357"},"observation_digest":"sha256:370f45d5166135107d22196cec5c324feef91175230eae62272acf4a9932020e","observation_id":"9bd60c18-a9cc-4ce4-9dc2-387bbc900887","resolution":{"observed_at":"2026-06-30T07:24:21.279204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00454/citation-record","integrity":"/paper/2507.00454/integrity","json":"/paper/2507.00454/citation-record.json","paper":"/paper/2507.00454"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.924803Z","title":"Hiptrack: Visual tracking with historical prompts","venue":null,"work_id":"de47a993-eb74-44c3-870a-4fa3ddc118d6","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:03.495167Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:9905105779b509316fe83a1abca9ff85e9b8789326099dab10eb04ecdd9723ae","observation_id":"0634cba0-2421-4b87-88c0-09f2b4f9763e","resolution":{"observed_at":"2026-08-06T21:21:13.929103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.910999Z","title":"Robust object modeling for visual tracking","venue":null,"work_id":"274412ae-e63c-45b2-b479-533268e39fdf","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:03.562427Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:64a6f7b283e7aa1ac03ba03ce6b90fc96a8557af5b9aa76c1507608c7e163e60","observation_id":"eabbfb60-8b03-41bb-91cc-f8cc805ca021","resolution":{"observed_at":"2026-08-06T21:21:13.915407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.896795Z","title":"Ost: Refining text knowledge with optimal spatio-temporal descriptor for general video recognition","venue":null,"work_id":"8d815602-6ac1-49c5-8cc6-177a38bb276c","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:03.635785Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:173d1851713c3adf05dbaa576825c6eaa94bbd7e662008f03a51701a113bec09","observation_id":"b2115ddc-afda-49a4-93aa-6452e2a3f57e","resolution":{"observed_at":"2026-08-06T21:21:13.901038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.882604Z","title":"Seqtrack: Sequence to sequence learning for visual ob- ject tracking","venue":null,"work_id":"283eda93-ba82-48df-9c4c-4f9562c6af1d","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:03.711114Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:c53188b5d28139b27644628083016c0a941eb950edf93dfe849801e084e08fbd","observation_id":"d6c5bd46-d76c-4189-8199-7bc98634a03e","resolution":{"observed_at":"2026-08-06T21:21:13.887068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.868783Z","title":"Mixformer: End-to-end tracking with iterative mixed atten- tion","venue":null,"work_id":"ce469612-dac3-476a-9fb2-2eb664152ecf","year":null},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:03.807241Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:438937048f6d521a523a23d9b0d1e249a835660d8225e262857c377d0c897c0f","observation_id":"a36d3e90-8321-4c59-9d61-30a9f50cbdd6","resolution":{"observed_at":"2026-08-06T21:21:13.873201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15896","last_updated":"2024-02-07T12:20:21Z","snapshot_observed_at":"2026-07-06T15:33:11.344191Z","submitted_at":"2023-05-25T09:50:54Z","title":"MixFormerV2: Efficient Fully Transformer Tracking","version":2},"cited_work":{"arxiv_id":"2305.15896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15896","snapshot_observed_at":"2026-08-06T21:21:08.274808Z","title":"MixFormerV2: Efficient Fully Transformer Tracking","venue":"cs.CV","work_id":"a11b1979-c0dd-4e28-9b1d-b8833685e553","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:03.895699Z"},"links":{"cited_paper":"/paper/2305.15896","citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:0ff7dc9a15a8ca93e87a5db6bee66615defd58f37ac6c269f01b9141c4d736a7","observation_id":"b4c15925-262e-43c1-93f4-db01dc76931c","resolution":{"observed_at":"2026-08-06T21:21:08.313273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:21:04.010181Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.010181Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:3ab39c115def65e7569aeaa02acf95265001e7deb53f9be61096222dc03dbc4d","observation_id":"2b70bf93-1333-489f-aee9-e2bb68d051e6","resolution":{"observed_at":"2026-08-06T21:21:04.010181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.855476Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":"5879c411-3cbd-4d92-9f86-9955b770942b","year":2019},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.110836Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:b1556164374b916f537a8177c8a5cacc5ce479ba9c2e5b8d6804589fc36fa6c3","observation_id":"2da48220-6dc6-4af6-9e3a-21ca566761d3","resolution":{"observed_at":"2026-08-06T21:21:13.859467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.841761Z","title":"Siamese natural language tracker: Tracking by nat- ural language descriptions with siamese trackers","venue":null,"work_id":"c50c8a1e-1541-471c-ad29-a02ec199f526","year":null},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.177793Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:a0b8607061f7a09ffa2e335adf746d447828bca760f419af932ec32649408144","observation_id":"c932f6be-67eb-488a-8651-65a9c8cf0862","resolution":{"observed_at":"2026-08-06T21:21:13.846051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.827516Z","title":"Generalized relation modeling for transformer tracking","venue":null,"work_id":"f06cbda5-0aa1-4e6e-8785-8ea172e2e738","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.242868Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:2a3e20f6e448574839fafe5ae32bbda4c898a366c4d8d2cba591d459d1a1938f","observation_id":"f43e7444-8140-4443-8336-05a45de9ae8a","resolution":{"observed_at":"2026-08-06T21:21:13.831765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.813479Z","title":"Siamcar: Siamese fully convolutional classification and regression for visual tracking","venue":null,"work_id":"43d438da-d169-40e2-8268-68af43f57bda","year":2020},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.345312Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:cc178c00ab98231e0c0964c51f65f510b5ec832ea3313fb5d78f8ca88c434665","observation_id":"a702d729-0758-4471-aacc-60cb5f5e99a8","resolution":{"observed_at":"2026-08-06T21:21:13.818032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.799546Z","title":"Divert more attention to vision-language tracking","venue":null,"work_id":"f69a73ce-ed3d-41cc-987c-dcb091104d1f","year":2022},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.494381Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:ad69484dfd7c223ffc4bb77b43ae4c060201ecc0a6aaad0e1fc80de7914acd6e","observation_id":"b178a3a2-e6b5-4675-8a29-79d9a77bd249","resolution":{"observed_at":"2026-08-06T21:21:13.804426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.785856Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"32fc1c07-c2ce-465d-9be2-ec4345b2e6ef","year":2022},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.590862Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:76cf71488cb89a7fdf8af393c42cb85545b08c22b66ad6dff5f363efa85deaca","observation_id":"d1e1ea23-8165-4bd7-b684-830a03a2a0bc","resolution":{"observed_at":"2026-08-06T21:21:13.790001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.771470Z","title":"Target-aware tracking with long-term context at- tention","venue":null,"work_id":"280d216c-e403-4ec6-b16a-54e7f30a5375","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.749674Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:783e4fce6c720101bf8053f2a3da0e93a74ac6d24bb133b45078d51ce7b76781","observation_id":"c21eb719-5b92-4c1f-ba85-e0dc9d398176","resolution":{"observed_at":"2026-08-06T21:21:13.776016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.757494Z","title":"A multi-modal global in- stance tracking benchmark (mgit): better locating target in complex spatio-temporal and causal relationship","venue":null,"work_id":"6288dd5e-150a-42fa-925f-2736b0dc8fc3","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.878689Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:ed9e6c65567709876a562c75829f8a0d70cdb53a12c34f7f0395df8b4464e2af","observation_id":"db567757-5c6d-4cbf-b351-a7e00a7646fe","resolution":{"observed_at":"2026-08-06T21:21:13.761688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.743576Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":"a813a3e9-a56b-4776-99a7-87c0e4b04ea8","year":2021},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:04.990174Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:17698b9f52f42278c472eb8a1011c1aea44600d5d1e04b3c6837a0935c203419","observation_id":"70a604bd-57af-43ad-af90-1cebdadefccb","resolution":{"observed_at":"2026-08-06T21:21:13.748053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.728935Z","title":"Rtracker: Recoverable tracking via pn tree structured memory","venue":null,"work_id":"bd94fd7d-d602-4409-a6d7-0222507516df","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.106071Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:c9a63a1f7b84ab83d2117a268cc3ad6b626ef4fc2bfd5c592dbc370591330a53","observation_id":"1a1abc37-1e63-44cd-bd3c-b35a96fa3a58","resolution":{"observed_at":"2026-08-06T21:21:13.733707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.713934Z","title":"Towards sequence-level training for vi- sual tracking","venue":null,"work_id":"795903db-33b0-405b-ae86-c9a4c99121db","year":null},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.230930Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:062dd2dc67cd64018bbd1cd3b5e5ddaadb6a4197daffc79f734032e9877db8c9","observation_id":"391f9ee8-b9d4-4ba3-b8d6-722e483c4b3f","resolution":{"observed_at":"2026-08-06T21:21:13.718635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.450377Z","title":"Citetracker: Correlating image and text for visual tracking","venue":null,"work_id":"45090bd8-85bb-4511-9d41-24bc153e8426","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.358470Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:b4e1457d52ffb23e2937dfaa36e98c0d3915ec898faf933821b43c2728f0b09a","observation_id":"c26405f6-b8d3-403b-b6a2-eac472e374ce","resolution":{"observed_at":"2026-08-06T21:21:13.635446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:13.197386Z","title":"Dtllm-vlt: Diverse text generation for visual language tracking based on llm","venue":null,"work_id":"1a61fe50-b996-480f-b9f6-8f669a1b809d","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.489098Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:9a2c373d0f69303ce303139968ec14b094ea7c6ae1af58e7ceacf7ef3961916a","observation_id":"886f1d5f-ed15-4466-93f3-ba4143f64452","resolution":{"observed_at":"2026-08-06T21:21:13.302631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05021","last_updated":"2024-07-29T02:12:15Z","snapshot_observed_at":"2026-08-07T23:21:09.526266Z","submitted_at":"2024-03-08T03:54:22Z","title":"Beyond MOT: Semantic Multi-Object Tracking","version":4},"cited_work":{"arxiv_id":"2403.05021","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05021","snapshot_observed_at":"2026-08-06T21:21:08.120114Z","title":"Beyond MOT: Semantic Multi-Object Tracking","venue":"cs.CV","work_id":"927582bd-b762-4b0c-8669-b1ca55a53795","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.618383Z"},"links":{"cited_paper":"/paper/2403.05021","citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:da15902663e7206bce89bd9511374783440c92e6624d54fb261182acf5671935","observation_id":"4f11bd9e-500a-4cdd-8786-fb5beb1d4da9","resolution":{"observed_at":"2026-08-06T21:21:08.163075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:12.888328Z","title":null,"venue":null,"work_id":"6798cde6-f2cb-4f64-a476-61c759a82fef","year":2017},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.728136Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:d163a4acd4d3885b03b29362adc5984d0ac02f87a3212b9c33899334d2b9fac3","observation_id":"2b0a9cbc-00e2-4fba-bcc1-13c1fb6f4899","resolution":{"observed_at":"2026-08-06T21:21:13.057046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:12.684210Z","title":"Swintrack: A simple and strong baseline for trans- former tracking","venue":null,"work_id":"7588b663-5a0e-44ce-ab38-6b426c78cef3","year":null},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.856313Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:d42be165092a141d86fec217d7168b816f3fb321fcccb4d18316465e17013d04","observation_id":"5011503f-7aa2-4a2d-8056-94d7647f901b","resolution":{"observed_at":"2026-08-06T21:21:12.777830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:12.448739Z","title":"Tracking meets lora: Faster training, larger model, stronger performance","venue":null,"work_id":"bbbcf2d6-b7f7-465f-b8c6-d25e5ce8c3b1","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:05.995947Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:2e460fba4dd004a9832a732cbbbe0e4f88667dc0bcf3418c8865e0bc6252d1df","observation_id":"eaf084b2-d4ad-448d-9ec6-fbf7829d4b75","resolution":{"observed_at":"2026-08-06T21:21:12.550238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:12.234501Z","title":"Tracking by natural language specification with long short-term context decoupling","venue":null,"work_id":"440ca420-7377-46ce-9649-db52e2b3405b","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:06.105323Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:558957858d338afb8d9c8ac61d17b1f58cb0b833405c29a1045b09bd9cb0a076","observation_id":"77c8ef6c-dc8b-43a3-bc8a-b950ded5fc8e","resolution":{"observed_at":"2026-08-06T21:21:12.343384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:12.019465Z","title":"Unifying visual and vision-language tracking via contrastive learning","venue":null,"work_id":"ed54508e-92e3-44cc-a1fc-73c950826181","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:06.246551Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:7571631c024e3a115990771fb5b15de08ca8e8c1763f7c4aea6c72d255b5ca1c","observation_id":"4f3ab851-5150-4666-9679-f7bf9a13dc81","resolution":{"observed_at":"2026-08-06T21:21:12.123095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:11.744086Z","title":"Trackingnet: A large-scale dataset and benchmark for object tracking in the wild","venue":null,"work_id":"9ba9ccf9-6db9-4730-a59d-f512da6b780a","year":2018},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:06.412887Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:dfb9e2da3dcca5486a2a9f0b9c4081c5d472f3dadc11496d2d495f2f9819da87","observation_id":"4afffe9b-0de5-45a7-a5a3-9e8e41b1db7b","resolution":{"observed_at":"2026-08-06T21:21:11.866219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:06.545414Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:06.545414Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:a1759c75e7f811dd5cac76c7c3452bd1b77fb68c0e0f5b3f9895faa633000117","observation_id":"11ce511f-a597-4d94-8a2d-43bd5d5a5c90","resolution":{"observed_at":"2026-08-06T21:21:06.545414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:11.370862Z","title":"Context-aware integration of lan- guage and visual references for natural language tracking","venue":null,"work_id":"a352b70f-9ac1-49e6-86f7-1e0b79602d07","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:06.691730Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:7fcb3bf5202263a2121c59589d39b17c8eb52df2d81ddae84065873e20f20766","observation_id":"2ccac787-eac7-48fc-b362-5d96d258a98a","resolution":{"observed_at":"2026-08-06T21:21:11.513979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:11.103441Z","title":"Chat- tracker: Enhancing visual tracking performance via chatting with multimodal large language model","venue":null,"work_id":"406b1d2a-f1b9-4baf-ab39-ff4de0044f70","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:06.808290Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:219eaf882ed8ff2abf518209daed3e8af84f8f6e7552f090923b382b76f60067","observation_id":"47e8c3f8-087a-489d-842b-f5551db649d3","resolution":{"observed_at":"2026-08-06T21:21:11.202632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:10.869449Z","title":"Towards more flexible and accurate object tracking with natural language: Algo- rithms and benchmark","venue":null,"work_id":"d1c31971-92c6-4bf7-be39-212b23f47f06","year":2021},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:06.922319Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:3089ddd436c1da01c14cac0fb6680b579bea47be0aca08ae4941766701d0883d","observation_id":"6905c2cb-a44a-4f2a-a8e6-199fbbf32e9a","resolution":{"observed_at":"2026-08-06T21:21:10.992361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:10.547153Z","title":"Autoregressive visual tracking","venue":null,"work_id":"365f386b-b646-41e4-9ca1-c9a072dcafef","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.042125Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:5c7ffb52f23cb25bf6ac33fc1889174177f81584325456ee909caada15b6208d","observation_id":"0440d920-f877-4a4a-995d-03cc064e50ca","resolution":{"observed_at":"2026-08-06T21:21:10.682233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:10.268896Z","title":"Improving visual grounding with multi-scale discrep- ancy information and centralized-transformer","venue":null,"work_id":"c6dfc567-daf7-46ed-9494-bca703b828bc","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.202804Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:7fa0a4d9f56cf67abd3469c67124e5717da766bd7e9a9112f255f06019eea6cc","observation_id":"b970d63e-fa50-44fe-a6dd-600895141981","resolution":{"observed_at":"2026-08-06T21:21:10.402450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:09.921826Z","title":null,"venue":null,"work_id":"d0b81cbe-f7ae-430c-b1c8-c8405cda2969","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.347044Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:c07fbf3f89a1ab6cd8525ada606e4b4435c861088710ec3748e5be5daf93404f","observation_id":"70f2c872-bded-448e-bab3-b82b5fd045f4","resolution":{"observed_at":"2026-08-06T21:21:10.155071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:09.583919Z","title":"Object track- ing benchmark","venue":null,"work_id":"417d0586-aea4-428f-98a0-ffa70f3d4f33","year":2015},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.447212Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:0bc2e905cbab86bf25ec3dcbb4c02e2238e693157fe7f4275b6e7fe8eb4f1946","observation_id":"0e722b8f-2db2-4702-a60c-816d6726111a","resolution":{"observed_at":"2026-08-06T21:21:09.720456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:09.451477Z","title":"Correlation-aware deep tracking","venue":null,"work_id":"9f3a2035-150b-4677-bbe5-2ca9ea994b19","year":2022},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.587470Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:f1368ce7f7ab65a28f89c8745c2c0e10bbdcc3557916a639fe9ba88353b9d85a","observation_id":"4ea25646-625c-4125-a4bb-cd649532ef37","resolution":{"observed_at":"2026-08-06T21:21:09.516437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:09.251250Z","title":"Autore- gressive queries for adaptive tracking with spatio-temporal transformers","venue":null,"work_id":"d937b9bc-612c-4477-8c5c-a3c87d5bdd93","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.678542Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:53bf7cedc2a012708239510166e766733e01dcec5788404e6d17a0e482f61081","observation_id":"502c8dee-b8f0-4046-acd8-0faf4c29afeb","resolution":{"observed_at":"2026-08-06T21:21:09.363218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:09.029645Z","title":"Learning spatio-temporal transformer for vi- sual tracking","venue":null,"work_id":"b900fb74-4eaf-4cd1-b41b-c04d6444d2b2","year":2021},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.754690Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:117cf8642f5d8b5a7d43f4cd08be390c918cd67a46351aba69267b93d701754f","observation_id":"54f03118-3210-4a38-92eb-94896ca203ec","resolution":{"observed_at":"2026-08-06T21:21:09.150372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:08.880773Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework","venue":null,"work_id":"41888dfe-d655-4dd8-b677-c3d96e4fb66b","year":2022},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.813342Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:bbd2c02cb737ae7501f1648aff79d4b4e7658b9d6e9c346aee870a842bf84cfa","observation_id":"33cdc7ef-33c0-4e99-984a-0690f2c19783","resolution":{"observed_at":"2026-08-06T21:21:08.924328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:08.767899Z","title":"Exploring the feature extraction and relation modeling for light-weight transformer tracking","venue":null,"work_id":"8e72b63d-9081-473a-ab94-5a7817c5a480","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.876163Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:71aea722edc5b98f1c66b595ac5e68d0677b6f634eb8a37367d2111ed9e6f940","observation_id":"09e8bdca-f269-459f-a03f-01a7f7d42358","resolution":{"observed_at":"2026-08-06T21:21:08.809214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:08.619837Z","title":"Ji, and Xianxian Li","venue":null,"work_id":"a94382cc-45db-41c4-9354-77dd0dfde020","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.946025Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:ce84578e5e96b4365913af8709f94777de1163f3b9d271ea44760ae28cc77f2f","observation_id":"536240b9-8b56-4e9f-b962-66ad43d28bc0","resolution":{"observed_at":"2026-08-06T21:21:08.669724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:08.488771Z","title":"Odtrack: Online dense temporal token learning for visual tracking","venue":null,"work_id":"6ea22ad5-a443-477e-83dd-5db19ff7ffff","year":2024},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:07.998946Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:f5b6b6a571d19f500bb1769a9c5c7c0cc1d0596746ac43eba9bf5d9501a0bc18","observation_id":"329e24f2-28f4-4ac2-8d79-c3daba8fe15b","resolution":{"observed_at":"2026-08-06T21:21:08.554193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:21:08.377869Z","title":"Joint visual grounding and tracking with natural language specifi- cation","venue":null,"work_id":"a0397735-806e-479f-aae4-a9a011a1b878","year":2023},"citing_paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:08.038670Z"},"links":{"citing_paper":"/paper/2507.00454"},"observation_digest":"sha256:38db8e94f54a3ec0d0743ad3ec38b30adad84bc2fe410cf2a04b8f397e94cf25","observation_id":"587798bc-d420-4fb2-8e7a-8fb7a4e99f4c","resolution":{"observed_at":"2026-08-06T21:21:08.433120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00454","last_updated":"2025-07-01T06:13:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:12:12.329085Z","submitted_at":"2025-07-01T06:13:34Z","title":"ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2507.00454."}