{"as_of":"2026-08-12T17:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db122e4b388d264b5a9647f8743ecc5f209ef8accfdd6d5e5c3149c298b0eff0","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:46:34.180369Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:52.859271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:14.988080Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-07T12:32:52.859271Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-11T16:21:17.209034Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.859271Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:cffffebee92f3a548efc231f34df6a0b5512e0bf1cdacb36ef759cfebb2a7761","observation_id":"a8c5eb12-65ec-487d-8628-b0f2bed9b148","resolution":{"observed_at":"2026-08-07T12:32:52.859271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-06T18:40:02.771931Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.771931Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:46b757089ecfd42f58d3e9ab56cd5fbcdf3481a963ee433a577038c010c4880d","observation_id":"34b3b1a3-7981-425a-a102-7663f633fb81","resolution":{"observed_at":"2026-08-06T18:40:02.771931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-05T23:32:17.938393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.938393Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:7a13d51a208b18c0ddce99003a7439b02a1768826cabb38fbfb1450327622064","observation_id":"e4436d2b-52f0-4d91-9374-14e51158659b","resolution":{"observed_at":"2026-08-05T23:32:17.938393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-03T21:42:45.907432Z","title":"LLaV A- MR: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-06T18:33:53.894178Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:45.907432Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:3582f12e4765d0013982590063f4ae9ca642c2379924d67bf8b878e16326c102","observation_id":"66daadb5-120d-4ba9-985d-3d3e1ae18f45","resolution":{"observed_at":"2026-08-03T21:42:45.907432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":"2411.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-07-02T17:27:14.988080Z","title":"Llava-mr: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":"0e50912d-ef0a-40b0-bffc-61df72e7c85f","year":2024},"citing_paper":{"arxiv_id":"2604.09037","last_updated":"2026-04-10T06:58:29Z","snapshot_observed_at":"2026-08-05T06:31:53.723325Z","submitted_at":"2026-04-10T06:58:29Z","title":"SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T17:37:40.373211Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2604.09037"},"observation_digest":"sha256:c5c3a5d901eaa18b4d548cc00cada5d69cc7bdbbaf535fdfa956b126fb709c47","observation_id":"4b3d4251-7538-4694-85e7-b6fa0d1c2d9c","resolution":{"observed_at":"2026-05-11T06:30:58.574381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":"2411.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-07-02T17:27:14.988080Z","title":"Llava-mr: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":"0e50912d-ef0a-40b0-bffc-61df72e7c85f","year":2024},"citing_paper":{"arxiv_id":"2606.06294","last_updated":"2026-06-21T07:27:04Z","snapshot_observed_at":"2026-08-04T09:48:32.503414Z","submitted_at":"2026-06-04T15:31:22Z","title":"Towards One-to-Many Temporal Grounding","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:48.455492Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2606.06294"},"observation_digest":"sha256:2a93dfff5c103db75ca87247f82f27f01335197db6673f5b4cffcdfb02b594f6","observation_id":"905d3179-9bae-429f-9fb5-bafc0ad4fb4e","resolution":{"observed_at":"2026-07-02T12:16:57.671960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":"2411.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-07-02T17:27:14.988080Z","title":"Llava-mr: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":"0e50912d-ef0a-40b0-bffc-61df72e7c85f","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:445d24eefaa6c6200c22cbbd9f9b35f54450575afae6fd576bbf3e013baf4fef","observation_id":"0b2b1842-8324-47dd-9e39-7e9d9215ef89","resolution":{"observed_at":"2026-07-02T17:27:14.990641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14505/citation-record","integrity":"/paper/2411.14505/integrity","json":"/paper/2411.14505/citation-record.json","paper":"/paper/2411.14505"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:33.987486Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.987486Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:4468ee2dbdbc18767abe918fe452d6dec8c70802ee1a61e1737dbfda9f668cf0","observation_id":"29aea9b4-9f57-4e3d-9a78-1ba0dd04daee","resolution":{"observed_at":"2026-08-12T15:46:33.987486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.822581Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"fb3302cb-37e0-461d-951c-1ea469d59eb9","year":2017},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.992151Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:39fb93bdf9436a5d3bc434d4235e5646999cdad8259478d49482cb80fe53aa85","observation_id":"5e137d13-e512-4518-8e9e-ad2bc1e43c5e","resolution":{"observed_at":"2026-08-12T15:46:34.826376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.811100Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els, 2023","venue":null,"work_id":"16418478-abda-497f-ad3f-c41a5b20f55b","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.995449Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a51408e160a859cfd490391c899aa16c9895442b6c49d000523815de6d6bfaeb","observation_id":"74001564-cdce-4479-9e12-72b00375fe3b","resolution":{"observed_at":"2026-08-12T15:46:34.815024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13473","last_updated":"2022-07-11T12:55:51Z","snapshot_observed_at":"2026-08-03T23:04:19.291839Z","submitted_at":"2021-10-26T08:15:47Z","title":"CTRN: Class-Temporal Relational Network for Action Detection","version":2},"cited_work":{"arxiv_id":"2110.13473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.13473","snapshot_observed_at":"2026-08-12T15:46:34.288140Z","title":"CTRN: Class-Temporal Relational Network for Action Detection","venue":"cs.CV","work_id":"bb596143-39be-445d-b2c6-15ff306754f0","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.999034Z"},"links":{"cited_paper":"/paper/2110.13473","citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:3fc97b74d12e2ddd469fbeaecfe7a4f700f0458150c7545d527dd4d1d3a1f7e3","observation_id":"df9a1c82-2d1e-4c25-bfc5-f7fdc5c9745f","resolution":{"observed_at":"2026-08-12T15:46:34.294023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.799243Z","title":"Ms-tct: Multi-scale temporal con- vtransformer for action detection","venue":null,"work_id":"38730941-d4f5-4c51-845a-4d674c5289bd","year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.003000Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:4ef978f8904d61a9944a392a7f2f4e5714fc16cfac20ada4446748642cefd431","observation_id":"49dd12b1-cddf-4b10-8a3f-e4b8a4f74c17","resolution":{"observed_at":"2026-08-12T15:46:34.803597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.006592Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.006592Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:7c0128fb08560a1f0aceadf5349d812ced831a73a553c95fa21bb03a0fa2c320","observation_id":"52de721a-5de5-496d-8f39-41286100187e","resolution":{"observed_at":"2026-08-12T15:46:34.006592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.780208Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"1639ebc5-c23f-4a34-8010-8c167d5f1ae7","year":2017},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.010324Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:742f02aa0edbe5304bfa1d59e0db6eb580c77889637885b90fd42c88c1c11c08","observation_id":"30268258-4e5a-45fa-8a3a-6bb5ef239cde","resolution":{"observed_at":"2026-08-12T15:46:34.784282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.768714Z","title":"Video action transformer network","venue":null,"work_id":"240a3f4f-b0c9-4e4e-8784-d8d35b2ed1c7","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.014040Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:67eb8b35aa434462e7165b37892a02058c4a9d5f99e1f8349c56b84b4ab36b77","observation_id":"0b4df684-294d-4393-afa5-0363afeb3d15","resolution":{"observed_at":"2026-08-12T15:46:34.772785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T15:46:34.017653Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.017653Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:c558e8e1e58b8bc83ef87e4da628e4092fda09b220852800c0ff545f6ffa5524","observation_id":"9aedc72a-7358-42f7-bd3f-c848bd9d4586","resolution":{"observed_at":"2026-08-12T15:46:34.017653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.757889Z","title":"Knowing where to focus: Event-aware transformer for video grounding, 2023","venue":null,"work_id":"90ad776a-7e42-4cc7-a3aa-d51d9fc15a0d","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.021559Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:e2001d278653ca3ad450a5bc94317839db5cf3db9c12279ce984b6c25c48b541","observation_id":"557fffbd-95b8-4070-9a83-357119e67536","resolution":{"observed_at":"2026-08-12T15:46:34.761744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.025371Z","title":"Efficient multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.025371Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:7cd36f2d12c4be9c42d7476b14b1d92bbcedd700c1f4aa4e891cb5b0b2700f7d","observation_id":"3488fcf5-b860-4968-b767-a0b37bab20db","resolution":{"observed_at":"2026-08-12T15:46:34.025371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.029064Z","title":"Dense-captioning events in videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.029064Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:0bd1a8940188382c75c49d935c0768f985f1fd48277d383d1640953681e9e479","observation_id":"2adcebb4-0b78-45eb-a74f-b2fb462a1e8c","resolution":{"observed_at":"2026-08-12T15:46:34.029064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.740200Z","title":"Temporal convolutional networks for ac- tion segmentation and detection","venue":null,"work_id":"f117785b-cec1-40b1-b444-7ba8df0fe0ce","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.032763Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:3047b166e728ee4a06e0b424074212412eb6e77a4a7dcf4144d00f04ebf3cee1","observation_id":"40028e2e-2684-48b2-aea1-10f5e0b6ea3d","resolution":{"observed_at":"2026-08-12T15:46:34.743835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.728577Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":"7f13b2a3-c104-424e-8c47-e8a1ad3d51b5","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.036780Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:4f7a6dbe3d84473d20ade2a8bdffb15790073c7a5e1bf54278308afc866a944c","observation_id":"1351cd3b-6637-480e-94f8-918d8740b673","resolution":{"observed_at":"2026-08-12T15:46:34.732984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.717040Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"c8a8e75c-6943-4812-9429-090735bfc3d8","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.040363Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:5546551de78ee347c91ba4ee60fa0d6a3a0f2358a5f6a8506a0766373363dee7","observation_id":"caaaa026-fd5e-4e66-b865-ec6984da59e1","resolution":{"observed_at":"2026-08-12T15:46:34.721157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.043808Z","title":"Mimic-it: Multi-modal in-context instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.043808Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:e43b4bf89b086d4af108004c12b21bcc19f3cd50de2c2bd5a4a68b23b7963c38","observation_id":"7d3f1942-2f5b-44ea-a7a4-3c544590db18","resolution":{"observed_at":"2026-08-12T15:46:34.043808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.047579Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.047579Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:76066f6e0f916957e5e9e657ad986b339e60fad8e7eee8bb1fcc35a38e79480a","observation_id":"4fb2af8c-fcc8-4136-9ccf-17de71e758c7","resolution":{"observed_at":"2026-08-12T15:46:34.047579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.690757Z","title":"A survey on benchmarks of multimodal large language models,","venue":null,"work_id":"7d0903be-dc43-4c97-adc1-e665f51487cf","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.051139Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:4461336174690ee55b34aefc779e470b9fe28563df1502281a860a73d12f701d","observation_id":"48d2f88f-bc4d-4379-bd57-59a0eb3a210b","resolution":{"observed_at":"2026-08-12T15:46:34.695108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.054794Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.054794Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:844713eeb2cc2c241d1119f8d552aaa073718db130a99b2b835c10d2907f7de5","observation_id":"7bc2fa66-4b8e-400c-b54a-8c4a5a35b30a","resolution":{"observed_at":"2026-08-12T15:46:34.054794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.672107Z","title":"Fast learning of temporal action proposal via dense boundary generator","venue":null,"work_id":"6efd8d89-aab4-476a-8708-d256fd83ad0b","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.058301Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:96600c933040f5c96414fce37f10dc31fdb499bf59307b92fca8f44b4821996d","observation_id":"5d95690e-881a-43eb-8591-e22017a0498d","resolution":{"observed_at":"2026-08-12T15:46:34.676050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.661083Z","title":"Univtg: Towards unified video- language temporal grounding, 2023","venue":null,"work_id":"f7a38b10-ab5e-45b0-9d84-95b935d32d24","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.061972Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:97516f115d2f0647a85a11c793a12a32244e0ed7c8681555601c58d9d47b71ca","observation_id":"9c8b8761-daf7-43ea-880d-fa85cf37a993","resolution":{"observed_at":"2026-08-12T15:46:34.664660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.650577Z","title":"Bsn: Boundary sensitive network for temporal action proposal generation","venue":null,"work_id":"37e8b796-d03a-4418-a976-03056cd79521","year":2018},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.066083Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:e0be2b00fe75f5c979c693001a30ee34fcbf51fd947f16ab5dce9168a1e3862c","observation_id":"71aee2b2-1ce9-4d9b-901d-e25aa33cfbf3","resolution":{"observed_at":"2026-08-12T15:46:34.654031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.069591Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.069591Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:96b47941b48a0de4d5b1e9acb2a2ab11289c14f1d3b7c1fc0dde26879737bf57","observation_id":"8c4996de-1346-4b70-a7d6-06e9f565ddd7","resolution":{"observed_at":"2026-08-12T15:46:34.069591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.631385Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"4f1bca84-fc0b-4239-a917-6e7d6b5e7531","year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.072992Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:5fa668f5f2ed48fc6e027876923df7041b9c7dce4862b655c49b38a572dc4c4e","observation_id":"1174f455-31c5-4ed0-948c-9c7b642a567f","resolution":{"observed_at":"2026-08-12T15:46:34.635444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.076530Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.076530Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:3d140ef0bd4ef80e40522d53d4384b9c3915f5426fbaea46af58566393605da0","observation_id":"71cbe1a5-0956-4492-b4c4-7d6b114981f4","resolution":{"observed_at":"2026-08-12T15:46:34.076530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.079946Z","title":"Valley: Video assistant with large language model enhanced ability, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.079946Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:e411f9cd1e420a2120bd2cee77dc046a841a4f665c8c0a1eda3253fb9cbc282d","observation_id":"246e3dfe-457e-4f15-ae4a-7c4edb6b7597","resolution":{"observed_at":"2026-08-12T15:46:34.079946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.605470Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models, 2024","venue":null,"work_id":"3157b84a-2cf7-49a9-b1f5-1d20a18bd3e1","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.083458Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:81277d6b52661a6d72d9fd253a28a3bf46768dadda98185ec71ec25db7dde8d5","observation_id":"19f0d48a-eb54-4200-943a-d996aed2b9e5","resolution":{"observed_at":"2026-08-12T15:46:34.609308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.594288Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval, 2024","venue":null,"work_id":"2b657025-8ae2-4423-9492-04346b7b1937","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.086941Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:b3132f2a994e5de7a1c81eeb50aeec2709717be800cf4a5ddea89e6ef8e7ea73","observation_id":"53832ca4-6755-4aa6-bf0a-05ee22e796cf","resolution":{"observed_at":"2026-08-12T15:46:34.598219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.582739Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection, 2023","venue":null,"work_id":"5cab16b3-174c-4515-81e0-e9f74a7d006d","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.090381Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a368f08df296d2acc4c56a676af0b93269aad60d15b7240861eb074e10c72eb9","observation_id":"b2bb8faa-3cb8-4b76-9c4a-eb24a7479be3","resolution":{"observed_at":"2026-08-12T15:46:34.586889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.571650Z","title":"Correlation-guided query-dependency calibration for video temporal grounding, 2024","venue":null,"work_id":"15c1e05b-57e2-4d12-91a5-de9e8a58e5d6","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.094038Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:0d60c606abbb43e3bdbd5df96d77a3f63ca370a8ae4e7da39c0f4c4ab9c0efba","observation_id":"fd5efcf6-9441-4802-8a47-4cacf6a24796","resolution":{"observed_at":"2026-08-12T15:46:34.575592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.560582Z","title":"Local- global video-text interactions for temporal grounding","venue":null,"work_id":"93d36dcc-9f61-4147-8a4c-56c6b7a66bb0","year":2020},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.097533Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:fe81a64757ccf045d95a1a47ca601d576fef56beeba442b5d34c46f9ceff88e2","observation_id":"8770941d-1da9-4a76-9b6a-9742bc443b62","resolution":{"observed_at":"2026-08-12T15:46:34.564426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.548933Z","title":"Pat: Position-aware transformer for dense multi-label action detection","venue":null,"work_id":"7cf4c58c-b09a-49e5-835c-025f6b8d0ab9","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.101057Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:c918e7aa7eee8cb26a22ad64b73e118a7cecb3ae11cdfc1241850c001c384921","observation_id":"04bc2f47-7523-40fb-8322-ba84ceab1104","resolution":{"observed_at":"2026-08-12T15:46:34.553015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.536975Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":"2213cc42-8e7c-47b9-8be8-0f67781561fc","year":2016},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.104973Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:f651c2fe0534081992648dd0503c0d299c6db07429f938fc646f0eeea14f196a","observation_id":"0fd47542-75b4-408d-8759-a2762961bf45","resolution":{"observed_at":"2026-08-12T15:46:34.541275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.526038Z","title":"Vlg-net: Video-language graph matching network for video grounding, 2021","venue":null,"work_id":"188b0990-54dd-45f6-87d8-42039bb60608","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.108323Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:037070bbb9ffbe698c0ef00302f27ead344036e2e991fe4da30bd5cfd1bf9000","observation_id":"06cf80aa-567e-4be8-b43b-a2f20b646461","resolution":{"observed_at":"2026-08-12T15:46:34.530151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.515485Z","title":"Learning grounded vision-language representation for versatile understanding in untrimmed videos, 2023","venue":null,"work_id":"5cfbb090-a5e9-4038-ab59-f2d244f2c9c6","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.111758Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:8a3d0ccf725d3480ba7bc8549367d7b47663cf656035089ccf40d232a312e706","observation_id":"2c06cbe0-62ce-4cf3-9857-2154ddbc99f1","resolution":{"observed_at":"2026-08-12T15:46:34.519074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.505411Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding, 2024","venue":null,"work_id":"37d94d01-53a1-4e04-92a5-873efbdeaee7","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.115164Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:afbb055648aadc2d044cf37acd0ba4781c27acf4c03b8c20f03768711825c3ef","observation_id":"a557d774-50bd-472c-a27d-9ebbf57e4a13","resolution":{"observed_at":"2026-08-12T15:46:34.508781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.495533Z","title":"Unloc: A unified framework for video localization tasks, 2023","venue":null,"work_id":"a4da9015-6f04-4020-9890-d898b5a31bb4","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.118300Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:59abbc321fa578c7f8b4c9b7214f16324bdc79072fbfcd534f52607f4cf69096","observation_id":"70727b54-4d97-42c4-8ec7-9bdd134efb16","resolution":{"observed_at":"2026-08-12T15:46:34.498670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.485341Z","title":"Unloc: A unified framework for video localization tasks, 2023","venue":null,"work_id":"193c38f1-806f-485a-9bf3-49ed2bd1384f","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.121669Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:2b3689781cea36497a88c9dc823b56b911e5fa33469b6112ed5b2048cd95fac5","observation_id":"b175bed0-7f32-4ac1-836d-2ab0537235bd","resolution":{"observed_at":"2026-08-12T15:46:34.489049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.474720Z","title":"Self-chained image-language model for video localization and question answering, 2023","venue":null,"work_id":"cfc6726f-2398-4971-a862-b8a429971d62","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.124891Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:f7f21778d650de30f2140e50477d8cd78109d5869800400f2162ec4275598727","observation_id":"99495fa3-ae96-4f4d-b2a3-a1b32e1025b3","resolution":{"observed_at":"2026-08-12T15:46:34.478605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.462469Z","title":"Semantic conditioned dynamic modulation for tempo- ral sentence grounding in videos","venue":null,"work_id":"2cbe7c01-5535-468e-9095-3f00534fb0dd","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.128070Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:7a9879ff85faf09f296b9b44144b8ba41fc8fc697c42438f0e77bbf21e2e4ea8","observation_id":"53683c38-2ee5-42a1-8334-a5ccb8a990e7","resolution":{"observed_at":"2026-08-12T15:46:34.466924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.450809Z","title":"Graph con- volutional networks for temporal action localization","venue":null,"work_id":"2e1460ce-52de-4fe3-a19e-88ac054c21b1","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.131043Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:6454db9b0477cb27b10496eaa12e77251cc5fd98ac557ab7e37b4826dd07f14e","observation_id":"3c4a4bbc-5325-4133-a3cd-864e8e3d07e4","resolution":{"observed_at":"2026-08-12T15:46:34.454748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.439644Z","title":"Dense regression network for video grounding, 2020","venue":null,"work_id":"009a8dc0-70cf-4825-aef6-e900e69e6da7","year":2020},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.134371Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:c2f0227fec69f5e7ee9df1d7b39a8919170028b672d313fdfce813df740d7574","observation_id":"abe0109e-633f-4829-b1b3-f1ac251df33b","resolution":{"observed_at":"2026-08-12T15:46:34.443580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.428548Z","title":"Unimd: Towards unifying moment retrieval and temporal ac- tion detection, 2024","venue":null,"work_id":"f00e72be-b95f-43d5-8f1d-8d0103e57de8","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.137745Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:605b6d1e1caea4cbc92a760ab6f82bf5aca0a8c9b547d9a6d1a603a31fc21814","observation_id":"16ead2ca-91f5-4d79-b4ce-19ee17466dc8","resolution":{"observed_at":"2026-08-12T15:46:34.432557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.416876Z","title":"Actionformer: Localizing moments of actions with transformers","venue":null,"work_id":"2ea31fc5-c96a-489b-b1fc-25239067ab8a","year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.141472Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:161a8dada9d4ad6b1831d69d009ec646c8d324d17b696c73b42ce57d2d646f35","observation_id":"6ffe070f-1deb-4aa9-bb1e-af6a2e1b46bf","resolution":{"observed_at":"2026-08-12T15:46:34.420874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.404982Z","title":"Man: Moment alignment network for natural language moment retrieval via iterative graph adjustment","venue":null,"work_id":"39a0e772-28c7-4466-aaa2-672f179208ed","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.145028Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:3cb106e158a0af02998f208ad38d9288a84e1b6f2b4e610fbd800641a3128b88","observation_id":"88ccc7a2-1faf-4697-a385-08e9d72ead34","resolution":{"observed_at":"2026-08-12T15:46:34.409042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.148600Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.148600Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:cd906a6d8499ff95c4bc2a51371e765f7df7ed6fcb029861945fdcfbdabb8a87","observation_id":"fb139d1d-1b80-4db8-8346-44fa833f7abb","resolution":{"observed_at":"2026-08-12T15:46:34.148600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.387264Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention, 2024","venue":null,"work_id":"e95c93e3-167c-43d5-b8f2-edfebb4fd1ff","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.151866Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:9d7c2402133a6ace87114e012ec0df9a9bec2d65dfa37815a603f374c6e99f6c","observation_id":"d70a4ef0-1d32-41b6-810f-abe85ea0bf88","resolution":{"observed_at":"2026-08-12T15:46:34.390918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.155307Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.155307Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:665f6efe640ee4b1bf763f928409f46be459b4d5bfab58672b23be25f4c52085","observation_id":"30d3c546-e572-4a63-9f0f-244e97c6613a","resolution":{"observed_at":"2026-08-12T15:46:34.155307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.368929Z","title":"Temporal action detection with structured segment networks","venue":null,"work_id":"eaaf82be-20a2-4205-bcf1-159a6f19809a","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.158791Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a3eb7a645faaa14e2adaf342ce521d9725f796aa04328e13274495c22487131d","observation_id":"0ce4def2-55cd-43a5-945e-ae64f5ff87d1","resolution":{"observed_at":"2026-08-12T15:46:34.372984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.358188Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":"64fc98b9-5bed-4dd4-acaf-9589c4157059","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.162165Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:2b03623ba903997cb2b22e99289a14577eeb033ad35e84561cdb9c10664841cb","observation_id":"8b0f7f74-0fa9-4704-9eb2-de4b3c8e6e6d","resolution":{"observed_at":"2026-08-12T15:46:34.361880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.346840Z","title":"Enriching local and global contexts for temporal action localization","venue":null,"work_id":"42aa4ccf-526d-461e-8ae3-9b84587564f6","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.165559Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:bbf52e54cbe00b3b88aaeec6d35afef0eb83748c99856dff9d62091e0c08a1ac","observation_id":"f7d3ba55-d9ba-42ae-ad0c-cea89989a227","resolution":{"observed_at":"2026-08-12T15:46:34.350436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.336058Z","title":null,"venue":null,"work_id":"ce55adf8-04b3-43e6-8c4b-b4beb1d1996a","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.168963Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a38622751166496f2aa9e849115bff4883f45b34e8e833c4d76ff1bc34bcd816","observation_id":"a8e99c9d-6d27-43a4-8ffe-5dd551089ade","resolution":{"observed_at":"2026-08-12T15:46:34.339358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.324820Z","title":"[[-1, -1]]","venue":null,"work_id":"5832e244-161f-495a-b63e-b5407c44b305","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.172906Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:c8ce88389baa86ee73c917bc0d53417521c599b13ae40a7d561d142a81f219cd","observation_id":"5eab3430-918f-4c82-ae81-aed16842eb78","resolution":{"observed_at":"2026-08-12T15:46:34.328503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.313389Z","title":"automated devices operating in a modern factory","venue":null,"work_id":"f0d975d8-d3c6-4adc-8ad7-fc32a6dc74d5","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.176858Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a0f25da99386faf3d51811dd3f88b083b009d912d057e19b9118dd1c2da77589","observation_id":"7c2b5e37-9af4-4a0b-9e1d-3aae182d0e2f","resolution":{"observed_at":"2026-08-12T15:46:34.317235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.302010Z","title":"This section explores po- tential future directions for enhancing the performance of MLLMs in moment retrieval tasks","venue":null,"work_id":"bc110c16-6830-4010-bd49-1b20d70df249","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.180369Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:ff4fa2426d66b85140dbe2af865ee778c6d8397109aa2b4949c40be5ef6cd6ac","observation_id":"8500c787-c420-47b0-81e9-08b5dc4e9d88","resolution":{"observed_at":"2026-08-12T15:46:34.305958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:38:56.387121Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 7 inbound Pith citation observations for arXiv:2411.14505."}