{"as_of":"2026-08-11T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da711828e7ff37ed6f8c0650f499b40ae385e7e06a1eab75d303c9e70965b82d","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:40:05.200664Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07744/citation-record","integrity":"/paper/2507.07744/integrity","json":"/paper/2507.07744/citation-record.json","paper":"/paper/2507.07744"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:12.296303Z","title":"Joint visual and audio learning for video highlight detection","venue":null,"work_id":"5412b76f-94e2-4680-9ee8-b309af022de7","year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.652223Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:ccdb3d1dcb5744705a0eaa1c943470579eb3f90c28a836f533734fdd80cdaebe","observation_id":"c171e9f0-1219-48da-b4e1-b594575d6f54","resolution":{"observed_at":"2026-08-06T18:40:12.354245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13441","last_updated":"2024-12-18T02:23:33Z","snapshot_observed_at":"2026-08-11T14:35:15.381001Z","submitted_at":"2024-12-18T02:23:33Z","title":"FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13441","snapshot_observed_at":"2026-08-06T18:40:00.715128Z","title":"Flashvtg: Feature layering and adaptive score handling network for video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.715128Z"},"links":{"cited_paper":"/paper/2412.13441","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:f9cdded37afe8b191b15ba239bb97eaf6a3d49afd750741d01d328071d552541","observation_id":"9dcd0f8f-f622-4c8e-b43a-e26cea825954","resolution":{"observed_at":"2026-08-06T18:40:00.715128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:12.141032Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"fb0ab3e2-27a4-432c-8a16-050f3d8a363f","year":2020},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.779071Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:09cd1b08618874040b8cdc94952fd9c6a37fdb0cd6478aa13b59bc5d230cceaa","observation_id":"8c7eba0d-06a4-4bbc-842e-ddab6282ee95","resolution":{"observed_at":"2026-08-06T18:40:12.193724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:00.848713Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.848713Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:479309a0462d6b66c5435cf30b46595270f80c4fdf5f9ac213cb4b9c0d5bdde4","observation_id":"654734bc-97cd-4a42-8fa6-90ae36976868","resolution":{"observed_at":"2026-08-06T18:40:00.848713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.942244Z","title":"The use of ranks to avoid the assumption of normality implicit in the analysis of variance","venue":null,"work_id":"bf88692e-05cc-492a-b918-3fe1602ef3ae","year":1937},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.913841Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:18df9a44c8b035c9b5f82c737a4cd6156122ecb25f7eca003a1808975790a6ba","observation_id":"75d26b24-e8b2-4486-8b32-79c9a7cc3419","resolution":{"observed_at":"2026-08-06T18:40:12.007086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.777432Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"d1b325dc-a356-4846-8bd4-faa0fcb1114e","year":2017},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:00.995731Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:0bb06f7b0f8e3694c0197cf930de44d04396faa74b1708a026560d936ed0a8a9","observation_id":"cdf82518-2ae2-4220-849a-0bf54a004368","resolution":{"observed_at":"2026-08-06T18:40:11.839389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.573949Z","title":"Clip-adapter: Better vision-language models with fea- ture adapters","venue":null,"work_id":"986bbdff-ae91-4d18-8293-f2c4d14191e3","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.076972Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:351da3d50e8182c7ea77632b45cd6035e69a4a3dc36dde1ade5bb6807de765c6","observation_id":"9e3b8fdc-7227-40c6-b3f7-6591f537a59f","resolution":{"observed_at":"2026-08-06T18:40:11.672575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:01.160740Z","title":"Saliency-guided detr for mo- ment retrieval and highlight detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.160740Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:0b117ed55dc1d2de6c3d8bd8dd61006519fa328b56d5aea6995e2fa0f94cc4fa","observation_id":"7058ff4b-37a9-4dfe-a399-c044ba2fbe00","resolution":{"observed_at":"2026-08-06T18:40:01.160740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01282","last_updated":"2024-12-05T17:07:57Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:54:34Z","title":"LoSA: Long-Short-range Adapter for Scaling End-to-End Temporal Action Localization","version":3},"cited_work":{"arxiv_id":"2404.01282","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01282","snapshot_observed_at":"2026-08-06T18:40:05.880614Z","title":"LoSA: Long-Short-range Adapter for Scaling End-to-End Temporal Action Localization","venue":"cs.CV","work_id":"607c1e63-6753-4e8e-8cd0-179d4da2b247","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.243689Z"},"links":{"cited_paper":"/paper/2404.01282","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:fa453f73428ebc98908658e1b156954c8958f2f9b5e775fd672141d3862b4dca","observation_id":"a7a763af-351e-423e-b119-84f00fc9f336","resolution":{"observed_at":"2026-08-06T18:40:06.018099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01745","last_updated":"2024-04-02T09:01:58Z","snapshot_observed_at":"2026-07-06T17:54:23.918329Z","submitted_at":"2024-04-02T09:01:58Z","title":"Unleash the Potential of CLIP for Video Highlight Detection","version":1},"cited_work":{"arxiv_id":"2404.01745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01745","snapshot_observed_at":"2026-08-06T18:40:05.709830Z","title":"Unleash the Potential of CLIP for Video Highlight Detection","venue":"cs.CV","work_id":"638570e5-894f-4927-bcab-550184a1809c","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.315277Z"},"links":{"cited_paper":"/paper/2404.01745","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:0eb8f445710f132044d0ddd9e5cded6cd77dfc6ecc50bbf34718a04ed14504df","observation_id":"be569355-1b5e-4e5e-9ee8-d15ddfbaf142","resolution":{"observed_at":"2026-08-06T18:40:05.757945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-06T18:40:01.379564Z","title":"Parameter-efficient fine-tuning for large models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.379564Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:c72fc3d7f79ac41f90b3e51062d5a2eb12ff907ad246f8a8b28a54c41c4eb26a","observation_id":"c87d8e20-ff76-4ffa-8e6b-08460fe55dd3","resolution":{"observed_at":"2026-08-06T18:40:01.379564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:11.384770Z","title":"Mini-net: Multiple instance ranking network for video highlight detection","venue":null,"work_id":"a4690fcf-72a7-458e-b989-b156bbf3fc92","year":2020},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.461875Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:b41c0f4461a750c02bbdbb6b7fc22728a5c2c2d28a2e4477c8d1c8b0a7370662","observation_id":"a5466ecd-48ef-446e-a5ba-6f557beac4a3","resolution":{"observed_at":"2026-08-06T18:40:11.490094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.987435Z","title":"Fifth berkeley symposium on mathematical statistics and probability","venue":null,"work_id":"dedf910e-d964-4c79-9dc6-b7bfb7ffdb01","year":1967},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.530384Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:d2d8bba8fd6f1637f161b598d179f8894687a52bba8757d7faef9cbbcf1c92d9","observation_id":"c99d1de7-495b-47b5-9e05-6b70969c5966","resolution":{"observed_at":"2026-08-06T18:40:11.152005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.618574Z","title":"Knowing where to focus: Event-aware transformer for video grounding","venue":null,"work_id":"cb497fcb-71b0-45ab-8f01-b12c53eb3099","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.644826Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:ed362bc59d9bea43047f1bf58972c6241aaa784aa22671eeca57c1e2ee3f092e","observation_id":"4bb2cb10-9f50-4a4e-b88b-35c86fc67807","resolution":{"observed_at":"2026-08-06T18:40:10.779308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.247667Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"61a6037f-6989-4da3-a834-a35e7b1cadc7","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.720406Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:211ee8fe98dc5b8880ef4a4f77cc4d92022cb17ef62219ce5fd19b957c22566e","observation_id":"d6455af2-90d2-4edc-8066-b87cf2bbe5d1","resolution":{"observed_at":"2026-08-06T18:40:10.378488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07648","last_updated":"2017-05-26T18:53:56Z","snapshot_observed_at":"2026-08-08T19:03:12.030897Z","submitted_at":"2016-05-24T20:28:53Z","title":"FractalNet: Ultra-Deep Neural Networks without Residuals","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07648","snapshot_observed_at":"2026-08-06T18:40:01.791278Z","title":"Fractalnet: Ultra-deep neural networks without residuals","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.791278Z"},"links":{"cited_paper":"/paper/1605.07648","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:25262e8329d05678443ddb514a961ba6d4eb6cde978527a5427ce97a41af9a74","observation_id":"027ddf54-2842-4fb2-af89-78088e6f6da9","resolution":{"observed_at":"2026-08-06T18:40:01.791278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.135500Z","title":"Bam-detr: Boundary- aligned moment detection transformer for temporal sentence grounding in videos","venue":null,"work_id":"a2346503-f59b-44d7-9d2f-e497e202feb9","year":2025},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:01.879168Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:15cf469cbe158f2428e666f5d07457bbe2f0e5bc2980562d1b31c0ebd290d71e","observation_id":"1ade79a0-108e-4edd-aaba-28d11e4eb1c9","resolution":{"observed_at":"2026-08-06T18:40:10.187552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:10.025842Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":"fa13720e-2fd1-4ce8-a835-46f01bb8acf8","year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.017528Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:fce8d90b46eb52815f088b38a78b005b110328b74eb3e81cddd3fefa9430f2b5","observation_id":"26a573f4-6ffc-41d4-82b9-e287e889ca43","resolution":{"observed_at":"2026-08-06T18:40:10.085279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.912017Z","title":"Dn-detr: Accelerate detr training by intro- ducing query denoising","venue":null,"work_id":"a185fa00-6880-4676-bb85-7b48ff30aed0","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.079804Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:bb57e714bf2e7a8ea3eed05984e0bf5fa43c3cb783f51c3c95aa72b86fb4f448","observation_id":"ac65712d-020c-41bf-9d4c-13f2eb98229f","resolution":{"observed_at":"2026-08-06T18:40:09.967704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.800527Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"b1a5c214-e622-4d1c-ba2c-8e02d0c43c93","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.199351Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:55a7c2ebd6ca1d1967ac91c394322b42f8cafcf142609357fb8bf537821af256","observation_id":"b3a7ea83-9220-4053-984c-0aa808346661","resolution":{"observed_at":"2026-08-06T18:40:09.857558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:02.316676Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.316676Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:9ae3bf4b2bda4ef1a6a148cfc520273657de1f4756ea9e720cab64efbede9b0a","observation_id":"beb6e54a-05e5-4ed0-927f-41a94c3afc0e","resolution":{"observed_at":"2026-08-06T18:40:02.316676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.667596Z","title":"Frozen clip models are efficient video learners","venue":null,"work_id":"fef81fb3-632f-47f9-80da-a1ce3047c6cc","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.409539Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:8edc3750523d33ff5c550b235f26a8bc08c653050504fe5d3c9c250d6c2f761e","observation_id":"9d306071-2c72-4600-a409-34c126147cb0","resolution":{"observed_at":"2026-08-06T18:40:09.737363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12329","last_updated":"2022-03-30T16:04:38Z","snapshot_observed_at":"2026-08-07T00:53:53.250783Z","submitted_at":"2022-01-28T18:51:09Z","title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12329","snapshot_observed_at":"2026-08-06T18:40:02.500974Z","title":"Dab-detr: Dynamic anchor boxes are better queries for detr","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.500974Z"},"links":{"cited_paper":"/paper/2201.12329","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:fb3643f94b620be30e3c7e8b1c6e5aff8488aa8cfa7c10ae0688dd0c6c80a6a5","observation_id":"f82a852d-52f8-4d0b-b24c-e873451843be","resolution":{"observed_at":"2026-08-06T18:40:02.500974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.521738Z","title":"End-to-end temporal ac- tion detection with transformer.IEEE Transactions on Image Processing, 31:5427–5441, 2022","venue":null,"work_id":"bde2ac80-7ec5-42dd-b25b-735a831f1f5b","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.567378Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:eed31d0dde67814470048fb3f3f5e26ca1e009001a367c925d56230bec9a009e","observation_id":"a4d84933-1429-4601-952d-6e011314d4f8","resolution":{"observed_at":"2026-08-06T18:40:09.576985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00801","last_updated":"2024-07-21T16:17:07Z","snapshot_observed_at":"2026-08-11T12:36:38.223733Z","submitted_at":"2024-03-31T21:17:48Z","title":"$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00801","snapshot_observed_at":"2026-08-06T18:40:02.643521Z","title":"arXiv preprint arXiv:2404.00801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.643521Z"},"links":{"cited_paper":"/paper/2404.00801","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:a670f2db9f38c8e1d0915d7a01f6e65daa8b0105262bc0e3c810b551f346f4cb","observation_id":"962d6db7-09bb-4a60-9218-3d4e5fe0ff3f","resolution":{"observed_at":"2026-08-06T18:40:02.643521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.424672Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"36c2820d-9309-4095-8bea-d2da77d17bf3","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.714083Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:9259268b165538630fa8e02382c06c371e125cc0791d55ff78d8e5b7e4dc387a","observation_id":"4bb7e029-ef6d-4f59-977d-318d65752d03","resolution":{"observed_at":"2026-08-06T18:40:09.450671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-06T18:40:02.771931Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.771931Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:bd276e678e86896d4a24737412b926604319aa53e37c1cf4c34515b81c3f05fc","observation_id":"34b3b1a3-7981-425a-a102-7663f633fb81","resolution":{"observed_at":"2026-08-06T18:40:02.771931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:02.837075Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.837075Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:8f76e7fd98eeac672633eb42a93542c7d3fac9612a7f7775eb18c5c1283a8e11","observation_id":"d8b4e273-c1b5-45ef-b906-8cbe788b8875","resolution":{"observed_at":"2026-08-06T18:40:02.837075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.286289Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding.CoRR, 2023","venue":null,"work_id":"9e659a63-7f48-4f02-ae20-5516df10e471","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.921358Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:c6a778d60fd76d27ac7b95f355c0677f007e0723a319a041d80a83ea14ba533d","observation_id":"f40d9eda-caae-4d09-a7d6-9c140d7b66e5","resolution":{"observed_at":"2026-08-06T18:40:09.354168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:09.153141Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"67addb96-0a87-42d5-8904-453932bd8835","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.042994Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:8f9a1ef56bb6bf8084855d296e212a814d19b825f4b5839083f93c7828d3dd68","observation_id":"96ce5b25-054a-4166-a25e-886ed9a96a9b","resolution":{"observed_at":"2026-08-06T18:40:09.205916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T18:40:03.121427Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.121427Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:e69f6b2573e220e11185fb52c9cab28901628c0e23756c8414a218009b40c57d","observation_id":"dd6a6245-faf9-4110-ad95-d857ae3466e3","resolution":{"observed_at":"2026-08-06T18:40:03.121427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.972633Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning","venue":null,"work_id":"0216f0e6-428b-477f-b995-f270f5f1bd42","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.202428Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:94385bf1bc61d7b8f052f0b28bc9bea6eade88d6f60588a9f1e537728ab81ea9","observation_id":"da0e6ad1-6cb4-4050-8c67-39d70e34a7a4","resolution":{"observed_at":"2026-08-06T18:40:09.051372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.772159Z","title":"Sada: Semantic adversarial unsupervised domain adaptation for temporal action localization","venue":null,"work_id":"5a5b2b29-b4f6-4b42-80d4-3421e29fa896","year":2025},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.289501Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:41d403151c975b80d67a40c695ba888eba422468d2c28a78b756e6dc13deed55","observation_id":"0019f4b3-10f4-4eb8-81ba-ed5f4fb2d95c","resolution":{"observed_at":"2026-08-06T18:40:08.867577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.558928Z","title":"Disentangling spatial and temporal learning for efficient image-to-video transfer learning","venue":null,"work_id":"f701f999-a236-42a3-859e-7044e8087e39","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.370771Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:2fcc2d9238460a1f2cc27042bcc5614d22a993efab5abf488fe70f8977417ada","observation_id":"d16eecaf-28d0-4610-b94b-afdcbbaf92c1","resolution":{"observed_at":"2026-08-06T18:40:08.643095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:03.510044Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.510044Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:952b74b56cc8d05d7b60220d7413c0d5e7a92a7a5c0f4504c0d630666e943190","observation_id":"ed20371f-0403-4410-b007-1bdccf5441a7","resolution":{"observed_at":"2026-08-06T18:40:03.510044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.357804Z","title":"Coherent multi-sentence video description with variable level of detail","venue":null,"work_id":"b2bb8ee4-c422-49eb-bef0-756a2072d0f7","year":2014},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.632073Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:f7f9e8fc006406496a0308e583bea6826df5d3bfd5e3474caab80505acade15b","observation_id":"cc3e3217-270b-42e1-b80f-c8f76e0fb56f","resolution":{"observed_at":"2026-08-06T18:40:08.444433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.202270Z","title":"Ranking domain- specific highlights by analyzing edited videos","venue":null,"work_id":"8f3b0e4d-106e-4818-a527-1b8560303a8b","year":2014},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.734332Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:e0238326ae1ad7d6f955a35bce7a9c8948773b71e014579b336e521fee3d01c0","observation_id":"22c1ed98-f3ce-4cd9-ae74-f64b4bd54f25","resolution":{"observed_at":"2026-08-06T18:40:08.271012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:08.052256Z","title":"Lst: Lad- der side-tuning for parameter and memory efficient transfer learning","venue":null,"work_id":"797a76cf-2290-4132-aa84-592c1941f70d","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.833480Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:4644157b844061c65c0e2de5af4af3293cdff35d9ff52c6f87acc0d02b562d79","observation_id":"55b6973d-c485-45ac-9314-207f4d83df5b","resolution":{"observed_at":"2026-08-06T18:40:08.112200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:03.914238Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:03.914238Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:80a965199b5ae6674c6309d43a7393f6ffcff90371ae9a9a166b6478a3b15bad","observation_id":"0afbd36f-a5ef-489d-9838-1bf659250beb","resolution":{"observed_at":"2026-08-06T18:40:03.914238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.846964Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"130ebf44-392f-465d-adf2-2e03c3ce223a","year":2025},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.067540Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:c4357c45e1c8959119c8257691325cad90e3908952d80bfd9932993366da96cc","observation_id":"dc814c50-2861-428e-a020-1ced0515292a","resolution":{"observed_at":"2026-08-06T18:40:07.944574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T18:40:04.192757Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.192757Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:f60096398ff55f68f88595681f0ff1cf31a09211bbde2ab5c5bb4bb7c4b2d1f8","observation_id":"dae05960-f941-4840-985e-c37e44273954","resolution":{"observed_at":"2026-08-06T18:40:04.192757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.592539Z","title":"Vision transformer with deformable attention","venue":null,"work_id":"697bcbe4-3f46-4e72-9760-d8a7c454d2a0","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.293577Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:fdfd8ec9c1bbabb86b5fbe1df8f1577bfd96b04d07645c929f54f8ea9ec1cac3","observation_id":"fcaac928-c242-44ff-ba16-b035f1054970","resolution":{"observed_at":"2026-08-06T18:40:07.710516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.422099Z","title":"Bridging the gap: A unified video comprehension framework for mo- ment retrieval and highlight detection","venue":null,"work_id":"59477921-f354-4b1f-a719-6aed9e3d6899","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.371035Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:d228320f4a2e2a2f1d1e4e814be360eb020c180a1ebaa54397ac0ecf71246e05","observation_id":"6e3c69d9-d6f6-42f5-b21b-21bce7ccd6d1","resolution":{"observed_at":"2026-08-06T18:40:07.511209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.220937Z","title":"Cross-category video high- light detection via set-based learning","venue":null,"work_id":"3dc7c427-be46-41d2-968e-4e3ccf24132d","year":2021},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.445706Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:b20f71020ea89fcaeafad12eb438535be9f88cdaaa5ed66ff624511efe8a3559","observation_id":"542b7c04-9546-4022-bcc1-47839712a2bf","resolution":{"observed_at":"2026-08-06T18:40:07.318203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:07.007740Z","title":"Unloc: A unified framework for video localiza- tion tasks","venue":null,"work_id":"55bd189c-3add-4e60-bc57-42001fc66b46","year":2023},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.563858Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:a80740e83379a3f347e8562fc71e44409c61052520ff6196a141f272cd79ff7e","observation_id":"f6177304-f351-4ff1-9927-97870806d7c9","resolution":{"observed_at":"2026-08-06T18:40:07.110265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.819867Z","title":"Understanding negative sampling in graph representation learning","venue":null,"work_id":"2249baf2-0715-4564-8a00-8435b21c5ccf","year":2020},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.698446Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:a0c914780685eec73944415955d558bb42f04baec1b8686410c52337ae4d3e4c","observation_id":"15576df0-3d5b-4402-aa8c-5705814ab4a4","resolution":{"observed_at":"2026-08-06T18:40:06.893073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.658393Z","title":"Parameter-efficient is not sufficient: Exploring parame- ter, memory, and time efficient adapter tuning for dense pre- dictions","venue":null,"work_id":"8c75f669-f5e0-4bbb-9642-6186e975c31c","year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.818146Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:47ec14515df6e56df2ace00ef850445d151cfc3a7e2a3c0d2e2c83b62a140b32","observation_id":"a89e8865-aa01-4c01-bda5-86a15edc9dd0","resolution":{"observed_at":"2026-08-06T18:40:06.739159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-06T18:40:04.919669Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.919669Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:8c2675e49e1bae9b777cd40b5fa77661c3c1679831c33d7a1264759e02a2461f","observation_id":"d05ac6e5-583e-49f8-a42f-a901e059b357","resolution":{"observed_at":"2026-08-06T18:40:04.919669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.449038Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":"7cebce8a-87f6-475d-8fce-bf1ed70ac200","year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:05.020736Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:eb51274fe20497f11bcc968bc457d3f0686cc483ec8d93d46cd64c5fe68aef5d","observation_id":"f196f109-36e6-44b2-a4b1-68282aa34209","resolution":{"observed_at":"2026-08-06T18:40:06.521597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-06T18:40:05.125881Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:05.125881Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:ce4a3a1fa4dfc4e5d91871fe4c37e63021e8ea4937e94666fd9897b105cebb89","observation_id":"93b92d5b-bd99-4e09-8c12-71c2c64db6fa","resolution":{"observed_at":"2026-08-06T18:40:05.125881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:06.260039Z","title":"Notably, these losses are applied to all the intermediate layers inde- pendently","venue":null,"work_id":"d733a1dd-713e-42d7-ad42-dceec31795ba","year":null},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:05.200664Z"},"links":{"citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:f799a9904df3e7b54e4491a07e33dcb5553181e5d6e997e0dc90b77268fc7911","observation_id":"60b4fea0-4029-4292-816c-9e4963f77bea","resolution":{"observed_at":"2026-08-06T18:40:06.366128Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2507.07744."}