{"as_of":"2026-08-23T13:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24f510e5ab91aa798149300b0b7c4535f205aa3f88b2463e064f1a080352a5a1","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:35:54.922566Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T06:33:36.846345Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T06:34:40.918877Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"cited_work":{"arxiv_id":"2505.12606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12606","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bimodalpolicyoptimizationforadaptivereasoning.arXivpreprint","venue":null,"work_id":"5133f922-66e4-4438-8c1a-83b5ac4435a8","year":2025},"citing_paper":{"arxiv_id":"2605.22138","last_updated":"2026-05-21T08:11:54Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:11:54Z","title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-22T06:33:36.846345Z"},"links":{"cited_paper":"/paper/2505.12606","citing_paper":"/paper/2605.22138"},"observation_digest":"sha256:f79f593e530e7b0e8ec858af2651e14de6b1e3bafd82c9ea75c750043f288b5b","observation_id":"ac86f337-d99a-41c3-a8ad-45ee4d7ba08d","resolution":{"observed_at":"2026-05-22T06:34:40.921134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12606/citation-record","integrity":"/paper/2505.12606/integrity","json":"/paper/2505.12606/citation-record.json","paper":"/paper/2505.12606"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.638283Z","title":"Fully-convolutional siamese networks for object tracking","venue":null,"work_id":"dcbff916-9305-4c70-b87f-e070babe8029","year":2016},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.702365Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:47c39bf85844b3851a971b28d7492e428cea1e0ef151d2368737ae6d4f78e3a1","observation_id":"aad54390-de3a-4a5a-95df-27ef567da53e","resolution":{"observed_at":"2026-08-15T20:35:55.642494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.624472Z","title":"Transformer tracking","venue":null,"work_id":"240a1362-de66-46e5-b123-cbc143278539","year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.707054Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:dc16514499fdd3ce0182fffe55117aaec52b67227f7462e1c975a5612f2fc28b","observation_id":"705244ed-0bea-4c29-9a10-8ae7a3b910aa","resolution":{"observed_at":"2026-08-15T20:35:55.629296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.612308Z","title":"ECO: Efficient convolution operators for tracking","venue":null,"work_id":"72bb333c-4073-457b-95c5-cc378d95ee93","year":2017},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.710838Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:559bbed0df8076ef7f012fffba468db5a201f3f9b252fd385e3ab5831d62cae9","observation_id":"ff937f3d-1851-40dc-a209-2e67632d671a","resolution":{"observed_at":"2026-08-15T20:35:55.616611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.599621Z","title":"Probabilistic regression for visual tracking","venue":null,"work_id":"1c875383-c83b-426d-bac9-c9dee2fc1d38","year":2020},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.715055Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:c208bff116937196b9ecd5fe3055e95b22ed14e3ba22b82416a3a6f0f6721218","observation_id":"d32eeea5-3ddd-402c-990e-eae624078da9","resolution":{"observed_at":"2026-08-15T20:35:55.604160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.718873Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.718873Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:61c754fe828e2f45a30db2f35d9134edcefe838c659175f119fdc7db8d68ef98","observation_id":"bbdb12e2-af53-4c6c-a499-2a072b2a8863","resolution":{"observed_at":"2026-08-15T20:35:54.718873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.579440Z","title":"LaSOT: A high-quality benchmark for large-scale single object tracking","venue":null,"work_id":"e074d926-ba42-42c7-9dca-362e4d8c2845","year":2019},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.722647Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:e7e5b9576b17f8fea6825342173af594984d4a292d52ffaecfea048fca29fec0","observation_id":"9b366b8f-9586-46cb-b145-ea7b20d19f56","resolution":{"observed_at":"2026-08-15T20:35:55.583742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.566612Z","title":"Siamese natural language tracker: Tracking by natural language descriptions with siamese trackers","venue":null,"work_id":"4a31ba1b-0b07-4ca4-8a6e-681721927f54","year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.726526Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:1b45dbf2f784c96e311e2fc7ca37df47a8fe217fc164d19e0778026f48679908","observation_id":"5d47ed8a-5bf9-45a7-ba58-da819f8d2924","resolution":{"observed_at":"2026-08-15T20:35:55.571231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.552132Z","title":"Geowizard: Unleashing the diffusion priors for 3d geometry estimation from a single image","venue":null,"work_id":"1da255ea-4c89-4c93-ac7e-8c059ca9d060","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.729996Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:e1c279c92fd45c0dde72be3c5c26643966ce30f87531377ee947855733ea8a18","observation_id":"0c37997d-1ebc-4549-900c-e8e6b166bac6","resolution":{"observed_at":"2026-08-15T20:35:55.557463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.540191Z","title":"Deep adaptive fusion network for high performance RGBT tracking","venue":null,"work_id":"e9135ef2-a250-4f07-bcfb-7d577deb0eff","year":2019},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.733720Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:c37d322186975dc15c4b0c8e9f158fb2675c2843c6badeaaca7fd18a7fbd0821","observation_id":"d49ff0b4-d774-4e4f-840f-c88c7f39e096","resolution":{"observed_at":"2026-08-15T20:35:55.544300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.527702Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"d9714004-84e3-439d-8fe1-8e039e5e1d53","year":2012},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.737151Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:c1c86ca6229a57af48ab722f42f88894e51f4d64721bba09fd1d1b1583e97593","observation_id":"9039c009-ee7f-48db-a826-6a966bce9efc","resolution":{"observed_at":"2026-08-15T20:35:55.532514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.740686Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.740686Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:f321a961f436553b1f393a14a718d6cf593ad4e84d8af11b80f6d725dc069b23","observation_id":"1ffbb455-5557-4523-a904-ec6a96719e70","resolution":{"observed_at":"2026-08-15T20:35:54.740686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.509821Z","title":"High-speed tracking with kernelized correlation filters","venue":null,"work_id":"644300f6-a9c2-46f4-9985-9a3afbe45abd","year":2008},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.744379Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:1d9b63b5eb79694d5e9265731a1a01427973932802bacd33bb61ad36385b85a2","observation_id":"d4918259-53c2-4678-a055-1bb0006665bc","resolution":{"observed_at":"2026-08-15T20:35:55.513657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.498348Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"d54eb96b-b5bb-4224-917d-457c92c82249","year":2020},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.748061Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:d975c8a3907e015f1cc72a2105cd9b6cbdf4aff7d4d291e400fee3c6545f7108","observation_id":"eba6c020-68c9-48e2-9887-ed7ed8bdf3cb","resolution":{"observed_at":"2026-08-15T20:35:55.502132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.486646Z","title":"Onetracker: Unifying visual object tracking with foundation models and efficient tuning","venue":null,"work_id":"718895c0-5399-4770-80cb-2305a2171bec","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.751624Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:2a36fec19dedd49e686cf31c05e5731e1d0467d6de31361ed9795d714e91debd","observation_id":"0d6b52a0-b017-4c7d-a44d-af85e2f9eaa5","resolution":{"observed_at":"2026-08-15T20:35:55.490749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.473730Z","title":"Sdstrack: Self-distillation symmetric adapter learning for multi-modal visual object tracking","venue":null,"work_id":"b7a3eb4b-5f70-40b4-99e1-2e86c58dcfdf","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.755267Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:b738a65e0010cf5fa6c7fa4b710042a04f9eee466b6cef3c3570ae9a6eb2603f","observation_id":"53c087ad-0fe2-465d-b88e-b8c54f4eac34","resolution":{"observed_at":"2026-08-15T20:35:55.478126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.758961Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.758961Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:03202f624d49865b17cfdde8d7bb2964208eef4be17e8e28864754a4991a01d3","observation_id":"7656bdf6-b8b2-493f-9ca7-898a8fb3eb33","resolution":{"observed_at":"2026-08-15T20:35:54.758961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.453535Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":"5a859f1f-009b-468a-b8d4-c9e6864e5e7a","year":2019},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.762572Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:ecd5bdcbef123b57dfca0cb7de041177f9adc49b7da018442d7216012009ced7","observation_id":"d1adf717-bd3c-4510-8c8a-cf3da1e4ee0a","resolution":{"observed_at":"2026-08-15T20:35:55.458454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.765744Z","title":"Visual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.765744Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:c181f85592ee2757247ab0ab24404ec800f3396c706fa6bab174d64b901c61c4","observation_id":"94682704-5871-4cbd-b884-8674ebbbdcc9","resolution":{"observed_at":"2026-08-15T20:35:54.765744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.769585Z","title":"Repurposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.769585Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:63d25757ee0bedf525e15aea9f0129e8a5a7fefcbea1b63cc4f7acff8127fde5","observation_id":"d2659a8e-a6cb-462d-9fb0-da0f2ba095cd","resolution":{"observed_at":"2026-08-15T20:35:54.769585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.426119Z","title":"The sixth visual object tracking VOT2018 challenge results","venue":null,"work_id":"ec31a193-b72d-42eb-bbce-b9ee9993cbd9","year":2018},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.773584Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:27c4d3df48b259258cde87a0d39d9d4dfafe0928f3527896105ab571c9a3a8c4","observation_id":"14f2d0d2-827c-467c-bc63-55a762686fc0","resolution":{"observed_at":"2026-08-15T20:35:55.430270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.412686Z","title":"The tenth visual object tracking vot2022 challenge results","venue":null,"work_id":"95aedd32-071f-43f7-b903-db480c4043ff","year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.777090Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:16522c4bd26c3f8c23a76b2fa22dfe629cff63a263517e1b514f4ef27208c2b6","observation_id":"72efa579-c028-4ee4-8ef2-e4bac786af99","resolution":{"observed_at":"2026-08-15T20:35:55.417077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.400406Z","title":"Stable diffusion image variations","venue":null,"work_id":"32a9db99-c322-406d-a9ac-da7319e527fa","year":2022},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.780579Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:9b88aa31480816f119a27f343427c1708a56b65ee1ec345523f2ca1a136b9b3e","observation_id":"8603501e-d3cf-4def-8a14-f77785fe6045","resolution":{"observed_at":"2026-08-15T20:35:55.404686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.784051Z","title":"Cornernet: Detecting objects as paired keypoints","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.784051Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:d4bbc74d9bbaf03f6d7c98cd052b6bde0ab98770b7bb6295d2f98b961a719478","observation_id":"9e1e1931-c5e5-455c-82c0-1243549691d4","resolution":{"observed_at":"2026-08-15T20:35:54.784051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.787540Z","title":"SiamRPN++: Evolution of siamese visual tracking with very deep networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.787540Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:ae2bf01038a241150d7b9df0646e7df36fd04bd94eff5c60804fe56d12fd62f9","observation_id":"fbfdce2a-3218-4e45-86ab-382b5af5191b","resolution":{"observed_at":"2026-08-15T20:35:54.787540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.373961Z","title":"RGB-T object tracking: Benchmark and baseline","venue":null,"work_id":"6e95f5bd-e65c-42f5-9926-eee9bafdab34","year":2019},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.791235Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:9e93bf369ae225b5f1ebeb058cf912288793a69e9c628031db86af1e47d98ae2","observation_id":"d7898066-aa07-482e-848e-69bfec4f8702","resolution":{"observed_at":"2026-08-15T20:35:55.378038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.360338Z","title":"Lasher: A large-scale high-diversity benchmark for RGBT tracking","venue":null,"work_id":"5472addd-9123-482d-9209-b1de47982fef","year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.795026Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:a2323b8d618ff6f763282b1da22710dd17072830b22c11443d9f065d7c1c2b52","observation_id":"51b3b29f-a612-4c80-9ec4-dbac26752a47","resolution":{"observed_at":"2026-08-15T20:35:55.365790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.347078Z","title":"Tracking by natural language specification","venue":null,"work_id":"3918abb1-9fee-4204-9f1f-f185e79c63a0","year":2017},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.798878Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:2e57b360dff8e4c237bcd60ab74d7d1b57c103a2a525008d00cf9aa6253b0f15","observation_id":"afd604ce-d5c5-4fc2-b98d-a5d1a548c31d","resolution":{"observed_at":"2026-08-15T20:35:55.351744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.333585Z","title":"Belongie, Lubomir D","venue":null,"work_id":"328f9ece-0239-4b75-8f51-ff4b6af104ad","year":2014},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.802644Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:4a07f9a13a8e7b954433933ba9b9f85b5130df570ba0a1a7ac789114470f0434","observation_id":"3d5e3f1a-0909-4de1-8a25-91d78f85cd3f","resolution":{"observed_at":"2026-08-15T20:35:55.337727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T20:35:54.805883Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.805883Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:00546d5b4b2bf6f7a197144073556f2fca41762b37ad8beb6b7dd252ae24a71a","observation_id":"20745626-58d5-41df-ba74-4100dcb190d8","resolution":{"observed_at":"2026-08-15T20:35:54.805883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.320818Z","title":"Narrowing the Synthetic-to- Real Gap for Thermal Infrared Semantic Image Segmentation Using Diffusion-based Conditional Image Synthesis","venue":null,"work_id":"6aef73c6-3162-4f1a-af08-651f3d32a583","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.809651Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:02ee7610f36554b7bd6fa788d75a71030eaddbf0767f84edf19ea6272c66c672","observation_id":"d6f1e6d9-600f-474a-b2df-63c900074710","resolution":{"observed_at":"2026-08-15T20:35:55.324922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.307538Z","title":"T2i- adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"f8bf6dcd-d0ad-4bbb-bd67-4cb0acd3750b","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.813162Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:4670d14d5f3215312a0444d74aff95884d1824c876ff05cf03000ab166f13844","observation_id":"7107b7b0-9967-4248-be31-125e7f6def6a","resolution":{"observed_at":"2026-08-15T20:35:55.312290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.294473Z","title":"TrackingNet: A large-scale dataset and benchmark for object tracking in the wild","venue":null,"work_id":"0890cd70-0ab3-4a13-99fb-8c655862d091","year":2018},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.816548Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:6959a2c942c3b317769a89102a5c8488995ff5c3c70f4556108e1d22b8c562a5","observation_id":"8eab2a34-a4e0-4a9c-822f-5b1e9f89ef7f","resolution":{"observed_at":"2026-08-15T20:35:55.299169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.281676Z","title":"Learning multi–domain convolutional neural networks for visual tracking","venue":null,"work_id":"ef40291a-270f-468d-9943-8c2e5895d1b4","year":2016},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.820084Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:c97f694744202dd8d021f4ac48cba14cf9a99ffbd956897fd0acff4e568c14b4","observation_id":"3f34eb64-95e4-4350-b1f9-8edd91376981","resolution":{"observed_at":"2026-08-15T20:35:55.285935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.823611Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.823611Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:688ee1bb9de627169f665b1028e1af794aa39a30c9ed63283bd2274dcccc8787","observation_id":"06572793-932b-4812-b7fd-c1d15de05a9c","resolution":{"observed_at":"2026-08-15T20:35:54.823611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.827538Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.827538Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:8bf9e2dfed5f9559cd82fc3c85b30028dccab0d5c6143347c5f5d5aee90c7468","observation_id":"b6becfe6-a078-4424-9369-12ee2167dc43","resolution":{"observed_at":"2026-08-15T20:35:54.827538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.251362Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":"fcc94e68-9743-4773-87d9-ef0b82aa10b6","year":2019},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.831495Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:7c54504e61a9f4f03f142a5e519588f236425add4737fccfee25a9001bf7eafb","observation_id":"f25372a8-6b09-4899-afca-a59a657b5e8a","resolution":{"observed_at":"2026-08-15T20:35:55.256208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.835071Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.835071Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:9e301ac2c0e718a664d39e4a8db76c94adb5e3084a8b33efd83b5ee982d6025d","observation_id":"e5bb35ee-c3c2-4347-807e-5f6d2efc9523","resolution":{"observed_at":"2026-08-15T20:35:54.835071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.838626Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.838626Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:e8557bbb883865715210cd57c027e92966e01980eb9b96489263873a1598b1c7","observation_id":"d4b38bd6-4934-457f-9702-677e1ba3f9fb","resolution":{"observed_at":"2026-08-15T20:35:54.838626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.224722Z","title":"Transformer rgbt tracking with spatio- temporal multimodal tokens","venue":null,"work_id":"4cd1248e-450e-4826-979c-c7ac7c653344","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.842442Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:9af0556a2f252874392fa52c89abbdbb23ec1c70e84dc6838c9967f88911b33e","observation_id":"de3c7583-527e-41e0-94d5-960d5c0a388a","resolution":{"observed_at":"2026-08-15T20:35:55.228589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17773","last_updated":"2024-11-28T14:51:48Z","snapshot_observed_at":"2026-08-18T11:39:45.570154Z","submitted_at":"2024-05-28T03:00:58Z","title":"XTrack: Multimodal Training Boosts RGB-X Video Object Trackers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17773","snapshot_observed_at":"2026-08-15T20:35:54.846053Z","title":"Towards a generalist and blind rgb-x tracker.arXiv preprint arXiv:2405.17773, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.846053Z"},"links":{"cited_paper":"/paper/2405.17773","citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:637dcbf58b7b7304b459eded8fe81cd138de8a5b73fcb4b5061906ec60614aea","observation_id":"120df161-bacc-49dd-a92f-0424c5d79b4b","resolution":{"observed_at":"2026-08-15T20:35:54.846053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.212096Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":"fd265b2a-53b7-4333-8562-ede64802774a","year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.850354Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:05d1b4f59a03bd944c1cbd97b9b24e9bcd58a1e3e660936a4010773675147ff3","observation_id":"fdac64c7-f6e5-43b9-813e-aca8e782377d","resolution":{"observed_at":"2026-08-15T20:35:55.216727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.200564Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"f6a8d64a-4a3c-4b1d-9027-c057c289096b","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.853891Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:f8ae8ecb4532457c559b73536c3c92ea6330a207e97099cfd39ad3aeaeb0910e","observation_id":"0f5b567f-4e7b-44ea-94b3-516d87f59976","resolution":{"observed_at":"2026-08-15T20:35:55.204396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05015","last_updated":"2023-09-21T06:50:36Z","snapshot_observed_at":"2026-08-16T18:03:56.772567Z","submitted_at":"2021-08-11T03:55:12Z","title":"VisEvent: Reliable Object Tracking via Collaboration of Frame and Event Flows","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05015","snapshot_observed_at":"2026-08-15T20:35:54.857390Z","title":"Visevent: Reliable object tracking via collaboration of frame and event flows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.857390Z"},"links":{"cited_paper":"/paper/2108.05015","citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:efed651a1bb69817837487c6372659ac337119c032bba1ca5a98fa7f34d311de","observation_id":"16d02971-0acc-4a4c-b962-87c7ff61f642","resolution":{"observed_at":"2026-08-15T20:35:54.857390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.188411Z","title":"Towards more flexible and accurate object tracking with natural language: Algorithms and benchmark","venue":null,"work_id":"6ca96f88-2f60-4ae0-b5ed-bec819e5f228","year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.861771Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:345f0262c4253b498c1627c5c554325e950e07cd1d837ad6d8d6a34b19ac0b32","observation_id":"c82250ec-9399-40c9-ac99-5907c4d2d57d","resolution":{"observed_at":"2026-08-15T20:35:55.192788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.175397Z","title":"E-motion: Future motion simulation via event sequence diffusion","venue":null,"work_id":"3eb1f4bd-58b2-445a-8a2d-79efecb196c9","year":2025},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.865423Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:b6e0426d621cf862b296a8675c8e40a3b7311a3f46933476c9e1fa5fb5b3fe9d","observation_id":"fcbd34df-7175-43d4-ba72-8521d8f12138","resolution":{"observed_at":"2026-08-15T20:35:55.179838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.163586Z","title":"Object tracking benchmark","venue":null,"work_id":"a4aa2022-ae07-4f2b-a5fb-63a24aa0ba25","year":2015},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.869292Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:38c0445e368fe932d6f3c07c5e66cb25d93e9df706741993c59144f42b4ef42a","observation_id":"e43429da-1f73-46ba-a141-007fcc74b46e","resolution":{"observed_at":"2026-08-15T20:35:55.167779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.150407Z","title":"Single-model and any-modality for video object tracking","venue":null,"work_id":"3d925e64-7bea-44e7-8cc0-1bb5d15b9402","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.873290Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:b5159dbf87aed70b1c4c8b09fec56aff20d01445fd55745df897a2355ca3eb74","observation_id":"474d023e-4cb3-4778-bce1-3d90c0db9e8f","resolution":{"observed_at":"2026-08-15T20:35:55.154893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.135421Z","title":"Multiple human tracking based on multi-view upper-body detection and discriminative learning","venue":null,"work_id":"cccb6f1d-c284-4fc1-b880-094b6faa8abf","year":2010},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.877114Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:d0f8f1301fd71186780467a634c5d2925d81f4434f362e8ac88466e95778b84e","observation_id":"2d125a98-848b-4338-952e-4f2c3f4aa086","resolution":{"observed_at":"2026-08-15T20:35:55.140124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.122935Z","title":"Learning spatio-temporal transformer for visual tracking","venue":null,"work_id":"6380ce3a-d316-4ce5-962c-1742fd8a808b","year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.880879Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:d93c08ada91b2e41212d0c99e32003ec3fa6db1c8607da437f81904a3e9a369d","observation_id":"b1c44179-b610-4b3c-988a-7d78f257b2e7","resolution":{"observed_at":"2026-08-15T20:35:55.127115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.109023Z","title":"Depth- track: Unveiling the power of RGBD tracking","venue":null,"work_id":"7f784200-c800-43b4-ba5a-cf679e7a09e9","year":2021},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.884703Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:1c05d6c2461a79d054e04751044c8a82aafee1301373ba7d42e44a43e45df07a","observation_id":"2afebe87-e411-425d-b9e1-4da6c7381c7c","resolution":{"observed_at":"2026-08-15T20:35:55.114657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.097173Z","title":"Prompting for multi-modal tracking","venue":null,"work_id":"759f44f3-033f-4a03-bafb-87c5f25744d6","year":2022},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.888531Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:e6de954aae2e9c7a61946cfbaa88e1dd1a6d02fb3031672dfeab0210da0453ca","observation_id":"eb323a9a-8769-4d4f-81fa-bbf922ec5b0c","resolution":{"observed_at":"2026-08-15T20:35:55.101082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.085358Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework","venue":null,"work_id":"c8ffbe72-10b7-4379-a200-25e4c243fb91","year":2022},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.892596Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:b2441dd9a58d1c0168c4fcccb252c6777823fad8e44a8c9715b5fa5b8fa7132c","observation_id":"b13b2ce1-f5f4-4055-93b5-5819dc2d2041","resolution":{"observed_at":"2026-08-15T20:35:55.089329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.896362Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.896362Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:6a0e3155e1ef79a8aaf369d37c9c488beedfd4d05203f21e9b7069627283f15a","observation_id":"e90c5164-1e3e-4642-8441-2d4729a1f1a1","resolution":{"observed_at":"2026-08-15T20:35:54.896362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07596","last_updated":"2023-06-13T07:43:10Z","snapshot_observed_at":"2026-08-20T13:57:40.162847Z","submitted_at":"2023-06-13T07:43:10Z","title":"Paste, Inpaint and Harmonize via Denoising: Subject-Driven Image Editing with Pre-Trained Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07596","snapshot_observed_at":"2026-08-15T20:35:54.900052Z","title":"Paste, inpaint and harmonize via denoising: Subject-driven image editing with pre-trained diffusion model.arXiv preprint arXiv:2306.07596, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.900052Z"},"links":{"cited_paper":"/paper/2306.07596","citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:e6afde320e9ab5c2d870ede9dcdcbb99097fcadcaff3fb1a9eb37591d969fae5","observation_id":"c70bd387-45d9-42bc-8baa-ff59514fe79d","resolution":{"observed_at":"2026-08-15T20:35:54.900052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.063049Z","title":"Diff-tracker: Text-to-image diffusion models are unsupervised trackers","venue":null,"work_id":"690d04e8-e049-40ab-9940-96fd020f20f8","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.904191Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:a137f0afc66bc2c98443c7a98253133c30ac095e289758709ff78e8045df7999","observation_id":"43dfd1b4-8c22-44de-ada1-37721fc376c7","resolution":{"observed_at":"2026-08-15T20:35:55.067828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.050322Z","title":"Unleashing text-to-image diffusion models for visual perception","venue":null,"work_id":"9e1cc8a1-bad0-49b6-94e2-22c08db39e0d","year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.908175Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:6e8b4cb035b90accf80ebc238dba2831ddedeca76218d3787d956fb14f67b88b","observation_id":"7b831a14-542d-44f0-9bfc-93cd53ab7521","resolution":{"observed_at":"2026-08-15T20:35:55.054664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.037247Z","title":"Joint visual grounding and tracking with natural language specification","venue":null,"work_id":"6028c3ff-0b12-4daf-b1dc-39d38194312c","year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.911798Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:af24aaff726dde5d5b90fe594b71b5b29780e5c84d9f4ca8da68301be2e09fd0","observation_id":"0b8efab1-7067-49d6-930a-7556cc8aef71","resolution":{"observed_at":"2026-08-15T20:35:55.041125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.023520Z","title":"Visual prompt multi-modal tracking","venue":null,"work_id":"08068ede-a48a-4dec-b416-27611e7c4473","year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.915541Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:11d425a8296ca7bb31b3815c58ed567ee276cd31f055a37c8a9f14ee70fd7bad","observation_id":"fde0bfcc-c433-4c65-a027-5eba4f70193c","resolution":{"observed_at":"2026-08-15T20:35:55.027591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:55.010545Z","title":"RGBD1K: A large-scale dataset and benchmark for RGB-D object tracking","venue":null,"work_id":"ea0fcc2e-d23d-4ec0-b478-cd5cbda63abd","year":2023},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.918920Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:ea4d5af0b2cd9171dff42cb989064ec09ee4ae9fb7e1a1a2e6db2de061d8b525","observation_id":"6b2969ce-dac8-4cc4-ae6b-85040f083fb5","resolution":{"observed_at":"2026-08-15T20:35:55.015232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:54.995522Z","title":"Exploring pre-trained text-to-video diffusion models for referring video object segmentation","venue":null,"work_id":"6f539293-de16-4896-b07d-59957408d83a","year":2024},"citing_paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:54.922566Z"},"links":{"citing_paper":"/paper/2505.12606"},"observation_digest":"sha256:64b01c579984821266cf69b307b064d57000089c679bc580cb2cece48c0ce422","observation_id":"3c8ef7b8-09b6-48c3-80aa-c1cb5f9aba70","resolution":{"observed_at":"2026-08-15T20:35:55.001458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12606","last_updated":"2025-05-19T01:42:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T22:43:36.112463Z","submitted_at":"2025-05-19T01:42:13Z","title":"Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2505.12606."}