{"as_of":"2026-08-16T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b22d4cd95e6ad7b2b20f87d9d0d4f6cd20b326ff7aade7b8cfe2f94581e7ac5a","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:22:06.576945Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.07410/citation-record","integrity":"/paper/1908.07410/integrity","json":"/paper/1908.07410/citation-record.json","paper":"/paper/1908.07410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.193248Z","title":"Aggregating local deep features for image retrieval","venue":null,"work_id":"d05379bb-f215-46b4-a62f-c2926a33e82f","year":2015},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.406085Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:4d679d083f74a6792f82bbf80202cdcd393c66c824a6eb64aaf5dbca54966d90","observation_id":"1bd8c0ea-601d-4c31-bfc1-80e9ba0de261","resolution":{"observed_at":"2026-08-14T12:22:07.198694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.177232Z","title":"LAMV: Learning to align and match videos with ker- nelized temporal layers","venue":null,"work_id":"521c0402-9e95-4860-8f36-2a3694c38bb2","year":2018},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.411085Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:e57c9682aa8b073069fd5a310e60cf586ce5c8fee65a683a5c4db13152f44813","observation_id":"44a20b06-953c-4542-8c90-dcfe9f0e7d61","resolution":{"observed_at":"2026-08-14T12:22:07.182279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.160156Z","title":"Parametric correspondence and chamfer matching: Two new techniques for image matching","venue":null,"work_id":"d5205480-b779-43a7-8393-64e40bc3f69e","year":1977},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.415774Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:a54ee13c050bb142087031be06e5907a26510179dd55f7bf3088084cdc58cd89","observation_id":"97a3120f-0f91-4a43-bbee-34b58c5b4074","resolution":{"observed_at":"2026-08-14T12:22:07.165875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.140944Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"d1e5f7da-5e79-496f-9f4c-c1f2fa522bb4","year":2015},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.420696Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:27962377c696763ec283323fdcde19eebd106d25a05576d0d5d80e8649e8519a","observation_id":"e58cd59b-948f-4f14-b9e4-6263e093241b","resolution":{"observed_at":"2026-08-14T12:22:07.149907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.125591Z","title":"Million-scale near-duplicate video retrieval system","venue":null,"work_id":"9b4c0193-ac47-46f1-b5a3-8564a55971ce","year":2011},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.425587Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:aa89fb9699e3fdfe51b903fa280155334c2da24138b5bc8d236e479f567d268c","observation_id":"db769508-0898-4e37-8324-335e25d9f056","resolution":{"observed_at":"2026-08-14T12:22:07.130861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.110421Z","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","venue":null,"work_id":"59e8290d-8dbf-448a-a9e8-e398664c8235","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.430695Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:658499f898f2203c8b01507fc6e181753772b055e4cb6017afeceab014df90fc","observation_id":"744fa5ae-114f-448a-8af3-6de1e62971d6","resolution":{"observed_at":"2026-08-14T12:22:07.115340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.094419Z","title":"Pattern- based near-duplicate video retrieval and localization on web- scale videos","venue":null,"work_id":"080205ac-d359-4a0e-908f-3e8eac795a9e","year":2015},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.436064Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:dbffbf1c95a45e15eb9000365c0fe02f45dda8144dff3e39ff9855717a2c6552","observation_id":"b6b81749-ebab-45f7-9978-4f79c42e4f83","resolution":{"observed_at":"2026-08-14T12:22:07.099372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.079509Z","title":"An image-based approach to video copy detection with spatio- temporal post-ﬁltering","venue":null,"work_id":"d667e522-727c-4bcf-924a-12c952377454","year":2010},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.440737Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:d3beeaa63ccae0bf427bf83a37a1ddbb2db2f9c9adbe84d9cab708f345e38769","observation_id":"978e1a25-b122-42ac-abfb-ea6c00054d0d","resolution":{"observed_at":"2026-08-14T12:22:07.084208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.064572Z","title":"Stable hyper-pooling and query expansion for event detection","venue":null,"work_id":"6c9b7df4-3ded-4615-8398-61637a9ac71e","year":2013},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.445470Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:df330d67b9c927b7b90cea9e037f122aa81b47a975ae6fd10856a3f077ff5322","observation_id":"fb82e88a-d43a-483e-8d1c-b20e0a3cafd3","resolution":{"observed_at":"2026-08-14T12:22:07.069863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.050686Z","title":"Video re-localization","venue":null,"work_id":"fd60b95a-f598-400f-b582-5b12e257dce1","year":2018},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.450222Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:e0881d26e171f5e7ce2c9edfa047882880c9d8b52ff1562aa975ce4845292ce6","observation_id":"92949879-d7b4-4cdc-a16c-2af72ca34654","resolution":{"observed_at":"2026-08-14T12:22:07.055241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.035476Z","title":"ER3: A uniﬁed framework for event retrieval, recognition and recounting","venue":null,"work_id":"e1af3ee0-aaf5-434a-a3b7-ac1e0aef6835","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.454983Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:4f6a722877120139b49949c1352550ae797f2df85e8e9789d77bcaace4d9ae97","observation_id":"09f480d9-2a7c-4a91-be1e-a320d45fd2d5","resolution":{"observed_at":"2026-08-14T12:22:07.040907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.019613Z","title":"Unsupervised t-distributed video hashing and its deep hashing extension","venue":null,"work_id":"9249a497-9fea-4679-bd67-6408b32410ae","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.459740Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:aa250e4720a87c4096c399b708d7697297b4173be9bc8f2fc5210c8b243418bc","observation_id":"82d05040-dad8-49a1-802f-7fc545569dba","resolution":{"observed_at":"2026-08-14T12:22:07.025268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:07.004079Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"526a438f-305b-4957-9b78-59f74841b5ea","year":2016},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.464219Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:4752ece3d691f7120e72e956fbc7ec8199be40c116b3eb6feaf3ee8277493d43","observation_id":"5af556c7-c8af-40e4-953f-2f9e6346ea07","resolution":{"observed_at":"2026-08-14T12:22:07.008937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.987639Z","title":"Learning spatial-temporal fea- tures for video copy detection by the combination of cnn and rnn","venue":null,"work_id":"cf887d6a-a478-45ea-9927-41cc7c756649","year":2018},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.468746Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:d6f24c6cfe1aa648b9a77e5154abcee7f136b92724cceaaa56608efcfa1f922c","observation_id":"1056a85e-448d-490b-9d98-5050c114b331","resolution":{"observed_at":"2026-08-14T12:22:06.992920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.971428Z","title":"Negative evidences and co- occurences in image retrieval: The beneﬁt of pca and whiten- ing","venue":null,"work_id":"341c9cf1-b7ff-42e3-9daf-ce22ea7928de","year":2012},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.473185Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:dc4a8f036e49adb095bef186d405dbcc0cf4f513071bb693d3bd6e1d92f174e7","observation_id":"30e472cc-c4e2-4976-b49e-c1ec7f149435","resolution":{"observed_at":"2026-08-14T12:22:06.976463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.956082Z","title":"VCDB: a large-scale database for partial copy detection in videos","venue":null,"work_id":"0e5f6ffd-665f-4448-9252-2c1df94cd83e","year":2014},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.477445Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:16a011b3681e99058384114a026867363e8a987d7cea2fe08da6dd851a0f0d05","observation_id":"52ba0457-e386-495c-9071-e137549a51b0","resolution":{"observed_at":"2026-08-14T12:22:06.961403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.940919Z","title":"Partial copy detection in videos: A benchmark and an evaluation of popular methods","venue":null,"work_id":"a18b9c7b-95af-4412-ac78-4002463fec5c","year":2016},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.481642Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:627cb9859721f71e3c6a89baf4221e56938fee0693b3b5d7b8b2ee53d4d4d5dd","observation_id":"cdad8eee-0b3f-403a-999b-03c66f92b62f","resolution":{"observed_at":"2026-08-14T12:22:06.945802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T12:22:06.485993Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.485993Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:91e5e8884051b6f0a22a59e30d360ba1b1cfeb4e33cd5083ea9c72af50706bc2","observation_id":"87d3fec5-9f34-487a-9cdb-019fd8d14afe","resolution":{"observed_at":"2026-08-14T12:22:06.485993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.04094","last_updated":"2019-03-24T08:59:05Z","snapshot_observed_at":"2026-08-14T18:29:50.730929Z","submitted_at":"2018-09-11T18:09:44Z","title":"FIVR: Fine-grained Incident Video Retrieval","version":2},"cited_work":{"arxiv_id":"1809.04094","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.04094","snapshot_observed_at":"2026-08-14T12:22:06.652047Z","title":"FIVR: Fine-grained Incident Video Retrieval","venue":"cs.MM","work_id":"3c6e335f-0338-49da-bfc5-303efb68404e","year":2018},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.490960Z"},"links":{"cited_paper":"/paper/1809.04094","citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:c05d03479124d6b07c0b9f67a5fdef5c1da83396757d89667cb2db4739e0d6b8","observation_id":"5e4c8008-e3f6-443f-99cc-e6daac067fa0","resolution":{"observed_at":"2026-08-14T12:22:06.658827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.925719Z","title":"Near-duplicate video re- trieval by aggregating intermediate cnn layers","venue":null,"work_id":"e05e3ce3-6018-4f83-9311-fa1b9644e339","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.496244Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:2431d5d938ec67aba2d51b4eece32b15a6572b04e29d4a8325a7a4ae0ee092c2","observation_id":"640d3315-a837-4bc1-a7f4-acd39753ed89","resolution":{"observed_at":"2026-08-14T12:22:06.930377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.909572Z","title":"Near-duplicate video re- trieval with deep metric learning","venue":null,"work_id":"97511922-366e-46d8-966a-b78734ab084d","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.500841Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:6024fd633bea9a13b9f98fc46248ef5b4411f3857e4ea0953137cefe1e8cabe0","observation_id":"e05498e9-e53e-4f0d-a1dc-36dfff043b2f","resolution":{"observed_at":"2026-08-14T12:22:06.914802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.894936Z","title":"IR feature embedded bof indexing method for near-duplicate video re- trieval","venue":null,"work_id":"9bd14a14-d7a4-417d-a396-737475425ee2","year":2018},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.505422Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:75819064c695f7f520ea7599af0873fd78238479c1c40d291fe3b142050f2de5","observation_id":"30a78e6f-1a0e-402d-b351-5a407c4e1e3e","resolution":{"observed_at":"2026-08-14T12:22:06.899672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.880181Z","title":"Deep video hashing","venue":null,"work_id":"3512e1e5-f1a5-41ff-b62c-2a7b36b518df","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.509877Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:7f6bfa02a0bdb71dd3de640d939bc71d96c2fbbab48552130a88268c1c0698a8","observation_id":"756e8935-76a7-48db-b017-3171bb19a5a4","resolution":{"observed_at":"2026-08-14T12:22:06.884937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.865621Z","title":"An image-based near-duplicate video retrieval and localization using improved edit distance","venue":null,"work_id":"f913e160-d23e-4cfb-9b2f-fccb77eeb7b4","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.514850Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:28ca8bbe346381dc22ba477341449ea1798bf13dfe2f0df06d92c4331d23749c","observation_id":"ee9381c7-0aa6-482d-a4e4-bfd3f02e146f","resolution":{"observed_at":"2026-08-14T12:22:06.870266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.851206Z","title":"Near-duplicate video re- trieval: Current research and future trends","venue":null,"work_id":"01d64994-309e-4f19-8ab5-5e00fed3dd21","year":2013},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.520626Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:80f6ce9206ef5065fcadbc01157b259c3a1fc527c263982ff609b710d95a1f5c","observation_id":"2078630b-5a88-473e-9182-5267f77dee2d","resolution":{"observed_at":"2026-08-14T12:22:06.855806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.835819Z","title":"Temporal matching kernel with explicit feature maps","venue":null,"work_id":"83bc4290-34ae-41b3-a84b-b9118169b83c","year":2015},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.525576Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:39cb66871ef2bb8b6c746ba79afa8ba905d4b6c1f781dbbfa807ddd6adb9a210","observation_id":"28692ec8-70cd-489d-a0f0-a85006c14fc9","resolution":{"observed_at":"2026-08-14T12:22:06.841153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.817984Z","title":"Fine- tuning CNN image retrieval with no human annotation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2018","venue":null,"work_id":"2c0b83aa-e204-4825-930b-2f3718a93068","year":2018},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.530554Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:1ce1712301c75be81c8bbc2c23fc25e2299f715dd8ea8a6a66c757060fbcf8d2","observation_id":"c534a7f7-77a3-4367-82f9-3a32fe0ce4a8","resolution":{"observed_at":"2026-08-14T12:22:06.823578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.801958Z","title":"Event retrieval in large video collections with circulant temporal encoding","venue":null,"work_id":"a1ac84a1-4dc2-4238-82c3-279246933a59","year":2013},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.535554Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:7fe4b6de26430d4624e61af4af95255b6d9ae76c12d091589a5c731c753d7db7","observation_id":"2b9672bd-c08a-4180-966f-4ca5e4b119c8","resolution":{"observed_at":"2026-08-14T12:22:06.807374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T12:22:06.539795Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.539795Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:9a6f139ccf49df73a40f80c1528a8bd235d5bdf25faec9408c879d95956ccb10","observation_id":"87fb26ea-b994-4940-9021-73cf1e40d7cb","resolution":{"observed_at":"2026-08-14T12:22:06.539795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.785862Z","title":"Multiple feature hashing for real-time large scale near-duplicate video retrieval","venue":null,"work_id":"325cf0f1-2c5b-4772-92e2-bbb9da711309","year":2011},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.544920Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:8ff2afa68a597a1d47936bd0782a0052bdc7f8642a256fdb770c55cf3349341e","observation_id":"03eaa98a-b17b-4dcd-90ce-e227f46c1667","resolution":{"observed_at":"2026-08-14T12:22:06.790806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.769117Z","title":"Self-supervised video hashing with hierarchical binary auto-encoder","venue":null,"work_id":"96301495-bc4a-4871-9462-fb70f48e9de3","year":2018},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.549326Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:310c84e7d3536f739d5a3dc6154098d9654aaed957e4bc21513de0ea9fb0e43e","observation_id":"b8df42fe-093c-4e44-9a4d-f85c410ed4a9","resolution":{"observed_at":"2026-08-14T12:22:06.774634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.752327Z","title":"Scalable detection of partial near-duplicate videos by visual-temporal consistency","venue":null,"work_id":"0a8d376d-4b42-4120-ba4c-8487ff3c5829","year":2009},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.553640Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:f5c9c33ac1592c2a3b3f06e48c850f1938dc9fa43e088593aebabb2dcf38d00a","observation_id":"8c3b8499-53f8-4786-a31d-d7b0a628ac47","resolution":{"observed_at":"2026-08-14T12:22:06.757209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05879","last_updated":"2016-02-24T15:14:34Z","snapshot_observed_at":"2026-08-14T22:22:21.992268Z","submitted_at":"2015-11-18T17:02:59Z","title":"Particular object retrieval with integral max-pooling of CNN activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05879","snapshot_observed_at":"2026-08-14T12:22:06.557962Z","title":"Particular object retrieval with integral max-pooling of cnn activations","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.557962Z"},"links":{"cited_paper":"/paper/1511.05879","citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:3d4bb7822759deb874ca62b08d5d2d3cc4561c9d05e81c32b63da2358f7f372e","observation_id":"bffb61cb-8375-4c4b-8c0d-783eff3a93d6","resolution":{"observed_at":"2026-08-14T12:22:06.557962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.736711Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"810069b5-a0c7-4873-bfff-c986bd4dbcc5","year":2015},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.562543Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:120d4481605467fc1afaa6824dc5f63465d29f9c44e20f53eb7d4467a9af01dc","observation_id":"2752d8cf-6010-4cb3-8c3d-5cdee156ba33","resolution":{"observed_at":"2026-08-14T12:22:06.741681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.720911Z","title":"Practical elimination of near-duplicates from web video search","venue":null,"work_id":"419dc89e-ee81-40e3-8389-2dc7d4d75d86","year":2007},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.567225Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:1f04df9020b0cf1d31753df7adcede9e333deff501eb6bb7241c9c7907da9325","observation_id":"6c970fc3-b3c9-4e61-86a6-44885d055e0c","resolution":{"observed_at":"2026-08-14T12:22:06.725691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.705165Z","title":"Deep multi-task representation learning: A tensor factorisation approach","venue":null,"work_id":"2228057d-b0e6-4907-bd13-6adf2f3ba1e4","year":2017},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.572231Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:b1ab17428ffbc6b3af7cf3a3f5e5e771ca0b89842e2c2a01404f8c36fc6c3bc0","observation_id":"12637740-d02e-49fb-be67-a8fb8803d607","resolution":{"observed_at":"2026-08-14T12:22:06.710187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:22:06.687343Z","title":"Hierarchical attention networks for document classiﬁcation","venue":null,"work_id":"80c772e2-d34c-41d6-85d4-ce38bc70de08","year":2016},"citing_paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T12:22:06.576945Z"},"links":{"citing_paper":"/paper/1908.07410"},"observation_digest":"sha256:79b6ee7f6f8332e8a1f9c2942ca81f4fa627b95b7a075c4e0634ff0d2065b472","observation_id":"5f241b75-b6d2-4307-921c-76ee32a940f8","resolution":{"observed_at":"2026-08-14T12:22:06.693241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.07410","last_updated":"2019-08-20T15:06:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:33:11.805991Z","submitted_at":"2019-08-20T15:06:24Z","title":"ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:1908.07410."}