{"as_of":"2026-08-11T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57ef14737ab4c86d4a0b4a59a7f3ba9261292bf0d0ede64875252904055bc76a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:06:17.358930Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02056/citation-record","integrity":"/paper/2608.02056/integrity","json":"/paper/2608.02056/citation-record.json","paper":"/paper/2608.02056"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.503847Z","title":"Tall: Temporal activity lo- calization via language query,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.503847Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:8a207d3fd05d2dbd032fce565810c85343589e9287d19512effdbac759d17b59","observation_id":"9fde840e-a60b-4fe9-b2f3-2d3ae6850534","resolution":{"observed_at":"2026-08-04T16:06:14.503847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.566895Z","title":"Retrieval-specific view learn- ing for sketch-to-shape retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.566895Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:6e1a98c4ba7895a652105759f23bb148de00bc753f2d17e9f2c05236b1ffafea","observation_id":"c3d0f505-392e-4ca8-900a-9df971ff1a93","resolution":{"observed_at":"2026-08-04T16:06:14.566895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.619502Z","title":"Beatdance: A beat-based model-agnostic contrastive learning frame- work for music-dance retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.619502Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:d050b50d3ae06be961516afdd3bea9cc1b3da7d33e7fd825d16053e1241c06e3","observation_id":"530217cd-b84a-4885-a83f-b5e314008e6c","resolution":{"observed_at":"2026-08-04T16:06:14.619502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.693020Z","title":"Momentdiff: Generative video moment retrieval from random to real,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.693020Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:557deaa68c699f5d62d3dee07beed782de7acf1cb1330d41ed54924b5ea5e002","observation_id":"8b5a11a3-3002-4ebf-b2c9-0de6e5ee6a56","resolution":{"observed_at":"2026-08-04T16:06:14.693020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.772097Z","title":"Detecting moments and highlights in videos via natural language queries,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.772097Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:b2aa67275e087075fdebe8a293919ab4b48eecff1c5fc702d867ae5bd8970343","observation_id":"b2dfc00c-fe43-4dcd-820b-355721f984d8","resolution":{"observed_at":"2026-08-04T16:06:14.772097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.861013Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.861013Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:858bb81f78d704bd1d1251a6b87c4a5240310803021430e81141f97e8f473981","observation_id":"c84da67b-f46a-44f2-88d2-faebd55e35e0","resolution":{"observed_at":"2026-08-04T16:06:14.861013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.891644Z","title":"A parallel transformer framework for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.891644Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:c2f7ccb54dc3c38abfa5487ba251e5bece4a6925c34e2a9887f65b2133a39007","observation_id":"9bb9a378-0a05-4636-8f8d-da2a6d6010e2","resolution":{"observed_at":"2026-08-04T16:06:14.891644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.952831Z","title":"Saliency- guided detr for moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.952831Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:823039aae55933c19a4b9f0ba81d85421be204c539be23fe80fa849e051b9e81","observation_id":"9a608a1d-7685-4117-84f5-ab5fa1be3dce","resolution":{"observed_at":"2026-08-04T16:06:14.952831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:14.989448Z","title":"Unimd: Towards unifying mo- ment retrieval and temporal action detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:14.989448Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:3403e87748d25b89d227ad84bfb2c012f27bbe4c79af0e6618e0ae7424c7cd2a","observation_id":"3d3db4b6-b9c6-43c1-b3fd-b9466b0aeb8b","resolution":{"observed_at":"2026-08-04T16:06:14.989448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.043888Z","title":"Estimating the semantics via sector embedding for image-text retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.043888Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:05380fe4bee347851ec6d109828bb1673fda453c31b279159e804dfe52926f07","observation_id":"bbe02bac-89eb-4830-9976-1ff9d09dc948","resolution":{"observed_at":"2026-08-04T16:06:15.043888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.095468Z","title":"Semantics disentangling for cross-modal retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.095468Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:7769d51dba7db74c575e6d0e866928ce2c94b0d7fedff5fcac11c243e46a6b2c","observation_id":"1651b8a7-67ea-4900-bfb7-8959d976d6b0","resolution":{"observed_at":"2026-08-04T16:06:15.095468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.130604Z","title":"Image retrieval using scene graphs,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.130604Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:fe236fafcbcde294cd68f3617bd1444a00e41f30c23364a6f380a31f70540ec2","observation_id":"e2fcd613-52f2-4230-acb8-61ef317453b8","resolution":{"observed_at":"2026-08-04T16:06:15.130604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.189802Z","title":"Look twice as much as you say: Scene graph contrastive learning for self- supervised image caption generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.189802Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:6623ad825a09b24f97524dcf0b9748c01ab17459538c415a564bab895cff6482","observation_id":"574b4688-1201-4667-b9f5-ec7b66c46529","resolution":{"observed_at":"2026-08-04T16:06:15.189802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.313204Z","title":"Image-to-image retrieval by learning similarity between scene graphs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.313204Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:f1c5afb421e7203cda03405ac8ad2ac54bb19e5ec853500daa5723afc0c1f3f7","observation_id":"71bd1279-5430-4af7-ac70-39725e4d7d5b","resolution":{"observed_at":"2026-08-04T16:06:15.313204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.361873Z","title":"Sgtr: End-to-end scene graph generation with transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.361873Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:ab5dabb091d80199f5643b3c2e7d187366416dd3428c23a70a26870808062413","observation_id":"7dbdbf05-28a1-40c8-80b0-ac7159b765c2","resolution":{"observed_at":"2026-08-04T16:06:15.361873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.422225Z","title":"Complex relation embedding for scene graph generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.422225Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:1e3455e6b82b994a7501329dbbabc1bf20351fceea301a8bc2ac76ae6b7e71ad","observation_id":"13e24287-7f2f-4e54-b0a4-385005fefc4c","resolution":{"observed_at":"2026-08-04T16:06:15.422225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.489111Z","title":"Spatial-temporal transformer for dynamic scene graph generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.489111Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:aacbd0e4ce568da30fee8980ca5d07550ab861f956de5594c6ffd8cad6d6d3ee","observation_id":"6d974c78-f954-4d33-96ac-b54cdf573417","resolution":{"observed_at":"2026-08-04T16:06:15.489111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.523501Z","title":"Scenegate: Scene-graph based co-attention networks for text visual question an- swering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.523501Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:54adbb9c4f00e29e8731fbebd054c0a295d5d1149ae1b0dcb3247e6c1bf03d0b","observation_id":"a4c50930-0ddc-444a-aed5-fbc9b4257b93","resolution":{"observed_at":"2026-08-04T16:06:15.523501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.580384Z","title":"Relational reasoning over spatial- temporal graphs for video summarization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.580384Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:f327c890d97e522b4a94359d44810423382070fbdc2bd7adee15cd78f8599bca","observation_id":"27464737-ab0f-4207-bc7a-67429e1424c7","resolution":{"observed_at":"2026-08-04T16:06:15.580384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.632000Z","title":"Multi-modal relational graph for cross-modal video moment retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.632000Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:283294c9c5b9b04b1558eebb75df03782e24fa5ea03d7176832968232f734fc6","observation_id":"e2c8d299-c138-488c-95ee-2986e3081da4","resolution":{"observed_at":"2026-08-04T16:06:15.632000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.703277Z","title":"Modality-aware heterogeneous graph for joint video moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.703277Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:cd35a4d729bd6cdb5a5408b167b1608e704a6307bcfff40b8d9dcc71ce9de7e7","observation_id":"a1147070-4d6b-4639-958b-22ca08a9d3f0","resolution":{"observed_at":"2026-08-04T16:06:15.703277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-04T16:06:15.764546Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.764546Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:cee4593d65dec240fe40f9e1d63ddc7c77de451a5a797feb0d1698f92849f154","observation_id":"ab997911-4180-40ff-9199-fb3680d570b5","resolution":{"observed_at":"2026-08-04T16:06:15.764546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:15.925057Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:15.925057Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:59c1de3e2d09e3f7053b7f239639137cb53623cd865246435359483acb4bc405","observation_id":"e3857890-0d0b-4f3b-b28d-269275034c90","resolution":{"observed_at":"2026-08-04T16:06:15.925057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.070853Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.070853Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:ff1f321c5844d9ba1dce8e305461098f52f7e5cc6fe00a8faa9ad5a9c4518887","observation_id":"bb4ddd0e-07d8-4958-9441-b0a610c39c5b","resolution":{"observed_at":"2026-08-04T16:06:16.070853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.198440Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.198440Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:b729ad740ebff8f1a1c1b50a15c550b40ae2b56843eab4473cf8a78d5daf083a","observation_id":"e2f98f40-8ae5-4b4c-a37e-65a725b5e7f1","resolution":{"observed_at":"2026-08-04T16:06:16.198440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.267276Z","title":"Debug: A dense bottom- up grounding approach for natural language video localization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.267276Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:3e91ab1c4c1a8db39c142aa91b3a554ebad6c59274430f36c377295910111b32","observation_id":"4a046450-cd0f-4a3b-851d-a6eb56178c29","resolution":{"observed_at":"2026-08-04T16:06:16.267276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.318752Z","title":"Man: Moment alignment network for natural language moment retrieval via iterative graph adjustment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.318752Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:9b7a5125fb320e88ec78d6979b10930df711779c45adeb2050b85ae374eb0364","observation_id":"481dcd74-26b9-4594-8bcb-6a200bb356be","resolution":{"observed_at":"2026-08-04T16:06:16.318752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.366436Z","title":"Dori: Discovering object relationships for moment localiza- tion of a natural language query in a video,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.366436Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:6c171da479c9fc9fcd0595c54611dd25ca7398488d9b074ec4db6de5bc56a04f","observation_id":"c375db6b-c8ba-43b8-a2b7-65b89f77d564","resolution":{"observed_at":"2026-08-04T16:06:16.366436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.428551Z","title":"Context-aware biaffine localizing network for temporal sentence grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.428551Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:7214c68e4a81e143a39d2bcca04708e7770a410c47ce7bb7f092524b214deb12","observation_id":"218afc43-f923-4da7-8209-966abbee2aa6","resolution":{"observed_at":"2026-08-04T16:06:16.428551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.490929Z","title":"Diving into the relations: Lever- aging semantic and visual structures for video moment retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.490929Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:d0a451919cb32af953ddfcbd82c4fc4053885bf103a58e31cee0af537ccb8ae9","observation_id":"df1183f0-c06b-4201-83f7-774d95f4bb70","resolution":{"observed_at":"2026-08-04T16:06:16.490929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.563938Z","title":"Negative sample matters: A renaissance of metric learning for temporal grounding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.563938Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:f64cab17834511e54b4d637eb2805d8a76414553973dcb504be88e85c59cede8","observation_id":"503b92cf-59d2-4b94-a226-53ec8d2f1038","resolution":{"observed_at":"2026-08-04T16:06:16.563938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.604786Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.604786Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:f9ef238bfb2d1b5171f2b437ea63546d2bec725df5298ce3dc0b49ef77d4c429","observation_id":"498cfb14-4db9-4e7c-8d4a-6baa1d9f1943","resolution":{"observed_at":"2026-08-04T16:06:16.604786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.666582Z","title":"Cross-modal dynamic networks for video moment retrieval with text query,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.666582Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:eddfdbf0e6d2b017817799891e3bb9b3bc725f5a50e195c58407050e2b096af6","observation_id":"091e3db8-d554-4f3b-9338-16c89a7cef3b","resolution":{"observed_at":"2026-08-04T16:06:16.666582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.861884Z","title":"Query-dependent video representation for moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.861884Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:a82b70d26cbef7768e9ed9bb3e4f579040d7ed618a21085c6373d5dfa9fac2a4","observation_id":"6e85b6a4-387a-438c-8ae6-4a912d9a3ccd","resolution":{"observed_at":"2026-08-04T16:06:16.861884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.890983Z","title":"Unloc: A unified framework for video localization tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.890983Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:5a62c464bb8dea2bfc0859e43c006b89dcc1777ada13f39009cc882560a81717","observation_id":"910b2275-6cb6-4799-82c4-84a8f794a771","resolution":{"observed_at":"2026-08-04T16:06:16.890983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:16.954445Z","title":"Towards generalisable video moment retrieval: Visual-dynamic injection to image-text pre- training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:16.954445Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:647747b537ba2b64fdce96eb50848ae5c4f26a9ca209bcf4dd689039bd577a7e","observation_id":"226c4501-f94d-46cf-933c-0ad70eaa9834","resolution":{"observed_at":"2026-08-04T16:06:16.954445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:17.031664Z","title":"Background-aware moment detection for video moment retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:17.031664Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:7bfc9c9d20dc745fc8aeb2ebb248112d15864777b438691867b78b1644c19118","observation_id":"9e72f2d6-f68b-4d43-a574-6e9d5d46e239","resolution":{"observed_at":"2026-08-04T16:06:17.031664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:17.064322Z","title":"Object- centric framework for video moment retrieval,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:17.064322Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:7b19cd67a2a51dec1e088278b5b57b5dedbfa92d08db30cc123e59b6835cfc94","observation_id":"9b5a4e6b-6674-4a16-a7a9-450c815f9c26","resolution":{"observed_at":"2026-08-04T16:06:17.064322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10678","last_updated":"2021-09-22T12:18:58Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:18:58Z","title":"Natural Language Video Localization with Learnable Moment Proposals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10678","snapshot_observed_at":"2026-08-04T16:06:17.120235Z","title":"Natural language video localization with learnable moment proposals,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:17.120235Z"},"links":{"cited_paper":"/paper/2109.10678","citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:02521ee66023963a72415e5ecb943e73d73fa7addd2fd60601a8e29224235781","observation_id":"6dbe5ba1-6cf2-4dbe-84c1-7285a953424a","resolution":{"observed_at":"2026-08-04T16:06:17.120235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:17.310695Z","title":"Fast video moment retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:17.310695Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:45b3d3d740f1eeb1ac3f9e5ed3ff3b39c47351b688322eeb2b4be8bda5c11248","observation_id":"aada9373-216b-49c2-b900-c03e461e490a","resolution":{"observed_at":"2026-08-04T16:06:17.310695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:06:17.358930Z","title":"Dense- captioning events in videos,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:17.358930Z"},"links":{"citing_paper":"/paper/2608.02056"},"observation_digest":"sha256:935f572ad137dc85c04e5ee82cbcff914d544def386da1f6dd848af4eb3fb7c0","observation_id":"48d430d2-fa0f-4e47-9549-9c3f91d5dfab","resolution":{"observed_at":"2026-08-04T16:06:17.358930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02056","last_updated":"2026-08-03T10:52:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:36:50.502601Z","submitted_at":"2026-08-03T10:52:32Z","title":"TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.02056."}