{"as_of":"2026-08-08T00:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd76dbfcb0638a63672ade465a4b7516e6649da7e73fcfe9b6995e80f1339f99","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:06:01.480557Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03473/citation-record","integrity":"/paper/2506.03473/integrity","json":"/paper/2506.03473/citation-record.json","paper":"/paper/2506.03473"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.888743Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"4c4aa4b6-fce6-4996-87ca-269d2e1e8476","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:59.319722Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:659b1d092253c70a180201f8997781bcb462c91521628ac6276eb4a56fe4b829","observation_id":"1845d173-b5c3-4c71-aa38-e5584a0e496c","resolution":{"observed_at":"2026-08-07T11:06:01.891983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.879174Z","title":"Fine-grained video- text retrieval with hierarchical graph reasoning,","venue":null,"work_id":"3cdd8152-f157-4e7e-8f27-3025031eac3e","year":2020},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:59.417913Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:7a55d0271fcabd6fa4116829b901b6824ca43dc303359f3faef60d0f63198733","observation_id":"e2ce0dd9-3280-4d17-8080-7a7a1845d65e","resolution":{"observed_at":"2026-08-07T11:06:01.882718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.869396Z","title":"Dual encoding for video retrieval by text,","venue":null,"work_id":"89d067d6-a267-454f-9a18-11f2e4b63105","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:59.536104Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:bea2bbf3e09b51a796258e2a966751dbcc878ebe0f7d97ace4374df0c3e68583","observation_id":"6d01a2bd-efaf-4490-b08f-cd46ead2bc01","resolution":{"observed_at":"2026-08-07T11:06:01.873413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.860251Z","title":"Hierarchical cross-modal graph consistency learn- ing for video-text retrieval,","venue":null,"work_id":"84d52cad-3159-4359-add9-7b73f68f0ffc","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:59.652787Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:744416af70ceea3579e209581a28d197dcd1a0ba228c9c49b01829413e4af73b","observation_id":"dc7db698-4a68-405f-9ebc-a68db13b1354","resolution":{"observed_at":"2026-08-07T11:06:01.863413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.850914Z","title":"De- confounded video moment retrieval with causal intervention,","venue":null,"work_id":"2f452600-73c7-48c4-b3a2-4b41837b9fc7","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:59.779954Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:100bb8f74321d439f156bc8769e35327fd33fc384fbce91b114d28229ff9a74b","observation_id":"79e11f47-0e5a-4929-99ee-e35636ad4048","resolution":{"observed_at":"2026-08-07T11:06:01.854142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.841015Z","title":"Cross-lingual cross-modal retrieval with noise- robust learning,","venue":null,"work_id":"8ff8b66d-896a-4b95-a6c7-1bf1bf28947d","year":2022},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:59.887631Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:97ecd33f7e5b25c0ca052be63c3d530dd2b8a7227a8686c11bd1624a5060caff","observation_id":"ea61853c-2f02-4818-bf9a-e12b73c0ad0d","resolution":{"observed_at":"2026-08-07T11:06:01.844487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.830423Z","title":"Partially relevant video retrieval,","venue":null,"work_id":"663b465d-534b-46a2-b389-e90e5d95cf56","year":2022},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:59.957909Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:7d1565464608c744ec489ea275eefe353b8bc230eb2aad61456d801caaedcb40","observation_id":"6bab4d6b-f409-43a1-a2f2-605250d9028c","resolution":{"observed_at":"2026-08-07T11:06:01.833867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.819617Z","title":"Bridging video-text retrieval with multiple choice questions,","venue":null,"work_id":"d39d6bd5-78c3-4ab8-931f-6d91160aa183","year":2022},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.025122Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:040d6ec4e60bd6eb1dce9e77ec080068bf4b8d0bd60959ce2a6adf659b2ebb28","observation_id":"569f4dc6-afed-4a62-ba49-b82a48b1f42e","resolution":{"observed_at":"2026-08-07T11:06:01.823274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.808199Z","title":"T2vlad: global-local sequence alignment for text-video retrieval,","venue":null,"work_id":"aa454749-b8a8-44ba-a3ad-1caf05b55fc5","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.103363Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:a3f12995f37083f50ddf7e722d80c92e5b390312cefceb2ac40ee16dd55076dd","observation_id":"9c620c7b-5ee2-4872-822b-b7f97165ac39","resolution":{"observed_at":"2026-08-07T11:06:01.812114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12216","last_updated":"2024-04-20T04:33:08Z","snapshot_observed_at":"2026-07-06T18:02:15.186390Z","submitted_at":"2024-04-18T14:20:30Z","title":"ProTA: Probabilistic Token Aggregation for Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2404.12216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12216","snapshot_observed_at":"2026-08-07T11:06:01.525497Z","title":"ProTA: Probabilistic Token Aggregation for Text-Video Retrieval","venue":"cs.CV","work_id":"af5d4b6d-3559-41c3-99b3-d7bb09b6dba7","year":2024},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.186517Z"},"links":{"cited_paper":"/paper/2404.12216","citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:ac226b05d955a73d9c8fd1a3a51ad4c6136f070b161371e9577fe09d20ed7b7c","observation_id":"46c5e87d-7daf-4d27-a172-490a4885b7dd","resolution":{"observed_at":"2026-08-07T11:06:01.530390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.797219Z","title":"Collecting highly parallel data for paraphrase evaluation,","venue":null,"work_id":"303be1c1-33c6-4514-802a-e53994fcb182","year":2011},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.270428Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:96d5c360a17a4fa11a28a72fb719f08779ba606281d28fde1f5414333ca7f7e5","observation_id":"654d0aac-5990-4f65-96f7-699e1a10e743","resolution":{"observed_at":"2026-08-07T11:06:01.800913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.787672Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"98b201c3-5339-4785-83f6-ab59d905d349","year":2016},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.361476Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:25dd69acfaf1c75f6a01e5147195ac43417b2b2ab427ca6a5a86f5a329679964","observation_id":"8a63a031-9a81-4b46-b75a-2d1045340348","resolution":{"observed_at":"2026-08-07T11:06:01.791033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.777135Z","title":"Vatex: A large-scale, high-quality multilin- gual dataset for video-and-language research,","venue":null,"work_id":"98ed6e1b-2e91-4a38-9e41-6f237091b1e4","year":2019},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.463326Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:82ca5110ef6404534d108214dccbe3f37483f1b929bf7c74d696486bfb2d4b7b","observation_id":"7467df0f-fe57-4602-bc4a-3984b0c34ccd","resolution":{"observed_at":"2026-08-07T11:06:01.780993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.765705Z","title":"Text-based localization of moments in a video corpus,","venue":null,"work_id":"b2359adc-6617-4fbc-8399-ac91d5ac5ac5","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.542884Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:1b4b0f7ccf0582fd0216d30597aef0f63abd6bd28e337ff0e07bb6e92a43daea","observation_id":"27f8bca1-1f36-4707-bd4f-c4c17c81257c","resolution":{"observed_at":"2026-08-07T11:06:01.769758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.755527Z","title":"Siamese alignment network for weakly supervised video moment retrieval,","venue":null,"work_id":"8cc38521-1b1f-4275-b447-47c3c77dc23c","year":2022},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.634619Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:918a48a78d51f72d39866be2f1acac2ff46b0dc1a1168d2d672153010153f202","observation_id":"1933e55d-35c2-4511-bf28-c0d2b460a854","resolution":{"observed_at":"2026-08-07T11:06:01.758900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.09046","last_updated":"2020-11-24T04:11:13Z","snapshot_observed_at":"2026-08-07T10:56:11.177050Z","submitted_at":"2020-11-18T02:42:36Z","title":"A Hierarchical Multi-Modal Encoder for Moment Localization in Video Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.09046","snapshot_observed_at":"2026-08-07T11:06:00.702867Z","title":"A hierarchical multi-modal encoder for moment localization in video corpus,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.702867Z"},"links":{"cited_paper":"/paper/2011.09046","citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:2a3c56c269ca47873e9b3e5a08be79acadf25bfe49f65a52f5264586f24d092b","observation_id":"cc34524d-b77a-4f03-9cf3-61f92123e1c9","resolution":{"observed_at":"2026-08-07T11:06:00.702867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.739654Z","title":"Gmmformer: Gaussian-mixture-model based transformer for efficient partially relevant video retrieval,","venue":null,"work_id":"79d024e5-09b0-43e6-b0c5-fcb44ea986f6","year":2024},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.768884Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:dc39ae19bb4f7ee93ed52ba739c52ddfaf3ab82fc73d01e4026adb1bbe962cc7","observation_id":"8a4bd7f1-28a2-4991-bce3-f68ab0e63592","resolution":{"observed_at":"2026-08-07T11:06:01.747850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.721117Z","title":"Dual learning with dynamic knowledge distillation for partially relevant video retrieval,","venue":null,"work_id":"e0dafaff-5272-4a0c-8b36-ada5fde92b33","year":2023},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.853883Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:b5a568aad9d30911b0372746cc9d56f96166c5bd7181807608bf6622f17840eb","observation_id":"f319975b-09c9-4ad4-840e-2dd5744e354e","resolution":{"observed_at":"2026-08-07T11:06:01.729763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.704146Z","title":"Progressive event alignment network for partial relevant video retrieval,","venue":null,"work_id":"fa0ec0dd-8fac-47d5-aaaa-a92cde0c6433","year":2023},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:00.869455Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:2e81052c3d137f9fb74d4799a24ef111e28375c9080c36fba907f266a11a047f","observation_id":"e877de4b-5938-4678-b363-8433ca181568","resolution":{"observed_at":"2026-08-07T11:06:01.711216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.684483Z","title":"Catr: Combinatorial-dependence audio-queried transformer for audio-visual video segmentation,","venue":null,"work_id":"fc9691d9-c829-46ea-89b5-ea52d578af16","year":2023},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.035912Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:3b38bd88bf841eef3db56e11245a4957a922f9463a99527970890e984ff7f750","observation_id":"56bbef10-041e-4e2a-ae69-092fd5cd8395","resolution":{"observed_at":"2026-08-07T11:06:01.691095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T11:06:01.199829Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.199829Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:4c8650752c61456f5a0e88c0a9fe8f202934c935373e27791f8239e4dae38335","observation_id":"e6bd9416-d4f2-4b09-9d53-e009fbccad26","resolution":{"observed_at":"2026-08-07T11:06:01.199829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.361144Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.361144Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:5f06c19a1a3d34b24e4375a9d8ab321c842d3c91487829ca166907b7e4cdf103","observation_id":"e78a1664-58a1-45e9-b0b7-8a893fa117e7","resolution":{"observed_at":"2026-08-07T11:06:01.361144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.663142Z","title":"Layer normalization,","venue":null,"work_id":"947c668c-78f3-4fcd-bfa6-ab349bf90463","year":2016},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.445078Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:9bbbdf43d5b1de504774acb875294794a711e18b6189919a7acc78da6d6c9cef","observation_id":"c592f822-eaa6-42de-8f0d-50418dccd2bd","resolution":{"observed_at":"2026-08-07T11:06:01.668926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.646570Z","title":"Multi-modal fusion and query refinement network for video moment retrieval and highlight detection,","venue":null,"work_id":"78a5c8b3-cbb5-4610-a666-65cb7b4fd93c","year":2024},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.451144Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:a2883a748d2e417f11ca9878d60ae6f8d10b8d494ea4a2c84343e64637be0f99","observation_id":"f30994d2-73e9-4fe7-86f0-cf026a9db7a0","resolution":{"observed_at":"2026-08-07T11:06:01.653102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.453906Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.453906Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:51de419bb7825b2d827c33bdab994a6f95d05e7ea1ab44361d72949962e1a12b","observation_id":"08641a80-a014-49e4-a5b2-0bd0405bc1e7","resolution":{"observed_at":"2026-08-07T11:06:01.453906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.625033Z","title":"Dense-captioning events in videos,","venue":null,"work_id":"a4552856-9ca3-48eb-b45f-58dd93e51f93","year":2017},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.456659Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:00f20a3affc06b80e9a7acec3e5d3e0842e11522cd03d3524be765f688e18eea","observation_id":"af270c4f-b91f-484b-bb1d-fcd8cdbaeede","resolution":{"observed_at":"2026-08-07T11:06:01.629970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.611784Z","title":"Tall: Temporal activity localization via language query,","venue":null,"work_id":"109e309c-7149-4123-8a8b-cd3b4ee12ec2","year":2017},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.459200Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:3368ab036aa16013c116980097ce231eb18fdc7505b1b41660dbb667261d6c00","observation_id":"34dd62ca-b8ba-47e3-aabd-ae2aeed1c7f2","resolution":{"observed_at":"2026-08-07T11:06:01.616944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.600315Z","title":"Tvr: A large- scale dataset for video-subtitle moment retrieval,","venue":null,"work_id":"17750630-eebf-4625-b8d5-d3aad393641a","year":2020},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.461741Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:88a088685a0fadb1ef2120a2377c993f0014ef568c133ed7b6933bf37a73aed2","observation_id":"bdeb12d9-0921-401f-8de0-2ebd9e9e5a00","resolution":{"observed_at":"2026-08-07T11:06:01.603962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.591591Z","title":"Local-global video-text interactions for temporal grounding,","venue":null,"work_id":"5dc3a2d3-6430-4502-961b-66078b16ee46","year":2020},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.464276Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:790c9a646e0dbf2a65cd870e35e5213aa3b097ccb9387952b36a86c1d18087dd","observation_id":"8fd6a693-aac9-47f1-8073-69388693ecde","resolution":{"observed_at":"2026-08-07T11:06:01.594480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.582089Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"4d1d12c3-8357-47e7-b358-05dfaa4828e2","year":2017},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.467668Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:51e7f8a892ef1a138f93e580ec425b7ac1ee69da29354369e562c7ceb46b2dcf","observation_id":"1f9f3ee1-5827-40c5-9c3b-f591ea831497","resolution":{"observed_at":"2026-08-07T11:06:01.585698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.572307Z","title":"Reading-strategy inspired visual representation learning for text-to-video retrieval,","venue":null,"work_id":"c86e42f0-bc50-44ed-98d5-3215a22376e5","year":2022},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.470300Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:2634359535b10e655d60f1faffb3062822fb20b0df2c77c854cc9ca12e3a6a10","observation_id":"b8c78e24-42e2-4928-b388-fccad05abfd5","resolution":{"observed_at":"2026-08-07T11:06:01.575642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.563241Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning,","venue":null,"work_id":"82ad94d7-ff8a-4d81-a57c-4115d690cf05","year":2022},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.472836Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:4d8f6550715ccfe7e0a75f2de753482ff1db34432e960efef74e3c1b21411869","observation_id":"c36be268-d94b-4e67-b452-788ae11da12a","resolution":{"observed_at":"2026-08-07T11:06:01.566415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.554457Z","title":"Cap4video: What can auxiliary captions do for text-video retrieval?,","venue":null,"work_id":"34d8bab9-e945-42ad-8f09-a3b49703b3ab","year":2023},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.475471Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:b5a5aaa38252cb011ef030dbca9be55603649c7c9d81a0d9850b59a82c5ae122","observation_id":"c85243d5-cc84-44da-89b3-f487a05a66af","resolution":{"observed_at":"2026-08-07T11:06:01.557435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.545606Z","title":"Video corpus mo- ment retrieval with contrastive learning,","venue":null,"work_id":"c4b73c10-bece-4d3e-8706-4c9e0a0696d7","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.477959Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:34d5ef3a276303dfbee23f0a648af0c2de00ffee09fff4a07de221e682600c5c","observation_id":"d445c8c6-0f0c-4a5c-8bfc-e888f76eaf26","resolution":{"observed_at":"2026-08-07T11:06:01.548683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:01.536674Z","title":"Conquer: Contextual query-aware ranking for video corpus moment retrieval,","venue":null,"work_id":"b03ce179-51de-4652-bb7c-1436408fc437","year":2021},"citing_paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:01.480557Z"},"links":{"citing_paper":"/paper/2506.03473"},"observation_digest":"sha256:a55a830372c134e4bffe29f72067ff34679ec33bbcbacb63c05e610f552b300f","observation_id":"06572c3f-bd27-47f0-a561-b9e3c1d7c923","resolution":{"observed_at":"2026-08-07T11:06:01.539699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03473","last_updated":"2025-06-04T01:08:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:59:59.752784Z","submitted_at":"2025-06-04T01:08:03Z","title":"MamFusion: Multi-Mamba with Temporal Fusion for Partially Relevant Video Retrieval"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2506.03473."}