{"as_of":"2026-08-07T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9e43e6be3646e0cc84296f22c567a4452ab1bd7cc6a2dc4efbe9156d0a6afea","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:22:47.913272Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T21:22:42.734111Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10180","snapshot_observed_at":"2026-07-14T21:22:42.734111Z","title":"TCMA: Text-conditioned multi-granularity alignment for drone cross-modal text-video retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14335","last_updated":"2026-05-28T17:22:42Z","snapshot_observed_at":"2026-08-02T20:03:42.104736Z","submitted_at":"2026-03-15T11:58:17Z","title":"Predictive Modeling for High Impact Active Learning Classrooms","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T21:22:42.734111Z"},"links":{"cited_paper":"/paper/2510.10180","citing_paper":"/paper/2603.14335"},"observation_digest":"sha256:55f865a618f1b8205d22f8fb48163b1c6a41ea329f4ac3877f4cc6557055c0d0","observation_id":"106d3b06-b4a1-40df-9332-5ef923dc458a","resolution":{"observed_at":"2026-07-14T21:22:42.734111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.10180/citation-record","integrity":"/paper/2510.10180/integrity","json":"/paper/2510.10180/citation-record.json","paper":"/paper/2510.10180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:44.460577Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:44.460577Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:31a18ff4b28b6428fad9918f2a6373dcc02851d80e062ad622624e26a57f898a","observation_id":"1bb86cdc-d7db-4d5c-8d97-42dfb5a472da","resolution":{"observed_at":"2026-08-04T10:22:44.460577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:44.534022Z","title":"Zhang, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:44.534022Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:6ec2f376981ad446f99cc0a88466a5d64eca4c824cc7249554ddd0ab9e705b7e","observation_id":"590b7b81-5d47-4bfb-9879-bf4c933131e7","resolution":{"observed_at":"2026-08-04T10:22:44.534022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:44.649474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:44.649474Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:f1ca0768019811c966dd0302488e5fc6eed494c08d97727a8ebcb8fdf139bcce","observation_id":"a9f5d2bb-6228-4a46-844f-b42cd9a2f0a8","resolution":{"observed_at":"2026-08-04T10:22:44.649474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:44.803393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:44.803393Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:c5e0d696d080ea73e5fa496c7afe5038744d9181d29ff13aa79cc242b0d4adf4","observation_id":"59e50212-2517-4de9-8a6d-4e656228a30a","resolution":{"observed_at":"2026-08-04T10:22:44.803393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:44.957213Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:44.957213Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:cd9bffaaf24b90718af3cc1fa0699ac6378a9bdb0bc0096290a21d18c9dcd9d6","observation_id":"01ae6f8b-8f78-494e-aec8-de7103b58657","resolution":{"observed_at":"2026-08-04T10:22:44.957213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.125152Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.125152Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:6bb2dab7ea8b22e0e0a37b1c87cfef60e5f822f3c7914b56a7ee71a1e20220ef","observation_id":"ff61d410-0988-4693-a996-bc343a64dcb7","resolution":{"observed_at":"2026-08-04T10:22:45.125152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.284859Z","title":"Bashmal, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.284859Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:59a2cd9b75fbb85ee21530638610540c129aa4fd5de3d52ec493f0a083b78ae2","observation_id":"22ee2e2c-7295-4178-9fb3-6f8abd7acfd2","resolution":{"observed_at":"2026-08-04T10:22:45.284859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.382719Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.382719Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:10236485c2a717e90db2d4d0296761deca3b2810cec278439e508ebcb8368065","observation_id":"e062bc5d-c806-4065-84c9-dcdb8f97984d","resolution":{"observed_at":"2026-08-04T10:22:45.382719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.458407Z","title":"Mishkin, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.458407Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:4eda539ee7da1e04d5c8d5abea3604e0ac0de8df8963c777fbda048fcace8840","observation_id":"34e01c54-b6f0-4af3-b2af-b6c95766e5a9","resolution":{"observed_at":"2026-08-04T10:22:45.458407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.558920Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.558920Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:49fd4a5e41aeb0e56726dad9a9002efc25d0337ae3b671ef61bd9069546808c6","observation_id":"d6d8f5e4-ef02-49a5-8f22-72ea1a58fc32","resolution":{"observed_at":"2026-08-04T10:22:45.558920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.641651Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.641651Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:28c13345785e2b6154ef17ef1bfb5a06bbf2f8f956055f83d8b9333d9fb8223a","observation_id":"e4b00f5c-60aa-4373-84a0-fb5744315991","resolution":{"observed_at":"2026-08-04T10:22:45.641651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.734836Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.734836Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:7f8b31d975906ed645b69967c5908f992378e512e273b174cf2f770cf4d050cf","observation_id":"d6f0a0e1-7ced-4c38-8932-4dd71bd423ac","resolution":{"observed_at":"2026-08-04T10:22:45.734836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:45.824698Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.824698Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:5005ed6e29e9e5b56f0b252924b57665835246dab3796b7bdb03720e38a2cb43","observation_id":"ef6a03ee-9683-4657-8428-85e6738e41d2","resolution":{"observed_at":"2026-08-04T10:22:45.824698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-04T10:22:45.895680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.895680Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:f381cd6545b311d6fac4f90b5bebc46105b8cd706c9b05e3e4914d42600c6efe","observation_id":"7ed984dd-c281-4f1b-bf8f-54d493bc3784","resolution":{"observed_at":"2026-08-04T10:22:45.895680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.015027Z","title":"Abdullah, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.015027Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:00bfe91f5875f23d115f1abee6d13de23c28403804840d490bd54b805619a461","observation_id":"956f49c3-a24e-40c3-9499-77718ae6cb1c","resolution":{"observed_at":"2026-08-04T10:22:46.015027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09868","last_updated":"2022-04-21T03:53:19Z","snapshot_observed_at":"2026-08-05T04:18:21.689354Z","submitted_at":"2022-04-21T03:53:19Z","title":"Exploring a Fine-Grained Multiscale Method for Cross-Modal Remote Sensing Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09868","snapshot_observed_at":"2026-08-04T10:22:46.080575Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.080575Z"},"links":{"cited_paper":"/paper/2204.09868","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:f3d0a5c2270aa6e7d7e44ced3db8e89c1f1380b3d476ff20c92eb24c9a97634b","observation_id":"1f8653b5-b7cb-413b-8286-088ee138b522","resolution":{"observed_at":"2026-08-04T10:22:46.080575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.154627Z","title":"Zhang, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.154627Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:a54d9cc70876e49cb53f3e975875f1e4ab9c8ec33b2e96aac0819e89b3f49cec","observation_id":"1c9d5cc4-f6b4-4e9b-b9a7-9e29506abae0","resolution":{"observed_at":"2026-08-04T10:22:46.154627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.226622Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.226622Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:bec7db6d9370375fa35fc9dc270e8ebf102662e715578e30df2914f55fee9eec","observation_id":"e88a43e6-22a8-415a-9340-cbfc761a2022","resolution":{"observed_at":"2026-08-04T10:22:46.226622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.277155Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.277155Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:2f9f662d1bf7452d2b882e1e18b94c9bba8ea13111560c0a9ea6af2c3139b60e","observation_id":"234c0672-860c-461a-a7b2-3d5a65199952","resolution":{"observed_at":"2026-08-04T10:22:46.277155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.357624Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.357624Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:b63a4b2363f83434e608daa3aff1289cac042e9048f328705e262c6c0569582c","observation_id":"53d74453-acb7-4f69-bae8-f399a9c3cde3","resolution":{"observed_at":"2026-08-04T10:22:46.357624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.419182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.419182Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:b01b1fd4e83a8c8aff45090ec56dca2eb90e076f1df03997e42e73f4c6bcc041","observation_id":"54008ada-5f45-46f6-9f9e-32f05d49db3f","resolution":{"observed_at":"2026-08-04T10:22:46.419182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.476141Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.476141Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:8cdf8df17357fd4dd9b2cb604d61589bc3cd3cd551c489697987a37af413f4e5","observation_id":"a4cf30f0-266f-42a5-b161-031b744ffc34","resolution":{"observed_at":"2026-08-04T10:22:46.476141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.554840Z","title":"Huang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.554840Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:8a5ceab44dd6cdb9e2e70b97038ada28038245694cbba5cf3dacbdd553451d3d","observation_id":"f0d5481b-4710-4c84-80b3-69dcff2ff6be","resolution":{"observed_at":"2026-08-04T10:22:46.554840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.623474Z","title":"Bashmal, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.623474Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:d8535eb92cbfee47ccdaa30506ecc9c0323aec78a2b1cc7b5e3655d8632a2964","observation_id":"179482ac-ecdf-407e-9895-fe5037f80183","resolution":{"observed_at":"2026-08-04T10:22:46.623474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.694721Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.694721Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:4d4ed61956dca1237a0f825d61c5c11efa16d740755772a195add9b223e69028","observation_id":"6776788a-1e2e-4101-a30d-5c5f45a2624b","resolution":{"observed_at":"2026-08-04T10:22:46.694721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.738770Z","title":"Miech, J.-B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.738770Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:576551415cc011b3d38c5edf5548c0f1933e8e053f221546f49e20f7fb431e41","observation_id":"510610cd-fb0c-449a-95af-9e57bdcf5abe","resolution":{"observed_at":"2026-08-04T10:22:46.738770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.807935Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.807935Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:bb84b518b7935cc73e7837e5b44130bc95f6e2f0f589094a262b1087972ff0b6","observation_id":"ffa56deb-0b0f-4e5c-9b66-a869ec183247","resolution":{"observed_at":"2026-08-04T10:22:46.807935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.856337Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.856337Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:093d5bb34000ca7084deed4f012d6e4ea243a92fbd3112c6da2f4757f8443b43","observation_id":"03d7f0a0-a98f-4267-9218-1bec38643c5b","resolution":{"observed_at":"2026-08-04T10:22:46.856337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:46.943324Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:46.943324Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:56d9fdcfb2e94a794546315efb928517d0c98163aa733de92a22f5437d99b12b","observation_id":"51800587-1abc-4133-a7a4-5eac95ab363a","resolution":{"observed_at":"2026-08-04T10:22:46.943324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:47.003285Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.003285Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:d74044e7e97d672622037150a278e2790862ebe2c4d6d412988c1c9394cc871e","observation_id":"9048bfa0-8656-4a01-8df7-59f99674d858","resolution":{"observed_at":"2026-08-04T10:22:47.003285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:47.093051Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.093051Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:e7f7bc86a6984043b030a1e024952e38db029e74a43b063cf6bae322f347f886","observation_id":"1100be56-daa0-423f-aade-b5ae13154f76","resolution":{"observed_at":"2026-08-04T10:22:47.093051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:47.191699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.191699Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:532b4d95119d1d1101263589cdbe3a5f8d8bd067aa2687d93f3ef0fc53ca503b","observation_id":"bf6f7ea9-6e42-4e75-8155-83bcc6b3a18c","resolution":{"observed_at":"2026-08-04T10:22:47.191699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04850","last_updated":"2022-03-17T10:40:11Z","snapshot_observed_at":"2026-07-06T12:27:02.281198Z","submitted_at":"2022-01-13T09:33:54Z","title":"Bridging Video-text Retrieval with Multiple Choice Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04850","snapshot_observed_at":"2026-08-04T10:22:47.264228Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.264228Z"},"links":{"cited_paper":"/paper/2201.04850","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:d26b26c54c826662ccd58c30cbf137f72bcadd4b0bc0c5e99c8736c70aef6e28","observation_id":"9ece25ea-56d2-489a-90ec-572230b7dec5","resolution":{"observed_at":"2026-08-04T10:22:47.264228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:47.341202Z","title":"Wang, Y.-L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.341202Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:79afc74aadc8ab511c73f66db63b684d60da6317943583b7b9d3b8b797a91082","observation_id":"bd924826-906f-4373-b8ea-f9e79e9188f0","resolution":{"observed_at":"2026-08-04T10:22:47.341202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:47.439103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.439103Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:1a49a5401533a3448ba76459d195ada04c9f6089f071d00a816fe89fe3a702bf","observation_id":"4c6aa5d6-0f03-4b91-8f78-113952aa9e7c","resolution":{"observed_at":"2026-08-04T10:22:47.439103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T10:22:47.511456Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.511456Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:b5d80dab02815c0a36d3a7645052a3fb51798b0ffc40798f2138e8f1dd25be99","observation_id":"49346f43-1a03-40d3-add4-903c2670181c","resolution":{"observed_at":"2026-08-04T10:22:47.511456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-04T10:22:47.603678Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.603678Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:2e054410f9908143d5d2f1196a957fac269aa0302b121e71a0f25efa38505668","observation_id":"00e5d461-90f8-4183-b0eb-5776421d736a","resolution":{"observed_at":"2026-08-04T10:22:47.603678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T10:22:47.720978Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.720978Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:5c73652c800c61bf81832784d487d1813b295def91817aec2b3b3bcf2f85d3a2","observation_id":"d1cb1229-f1d1-4f15-aec9-f6c5034c2bb3","resolution":{"observed_at":"2026-08-04T10:22:47.720978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T10:22:47.821628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.821628Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:b489fa33f9d29308e418f9135c54e3554fee999e831a906a88bc8239da983faa","observation_id":"abb34df7-6656-4d77-a44a-fd51d3e74735","resolution":{"observed_at":"2026-08-04T10:22:47.821628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:22:47.913272Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:47.913272Z"},"links":{"citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:5beb2178a923b10445ef7e963e2b1850ecc1d4dbb7358124720fb425a2670de6","observation_id":"e5713bb5-0af0-4cc9-ae25-f51402b1bbea","resolution":{"observed_at":"2026-08-04T10:22:47.913272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2510.10180."}