{"as_of":"2026-08-06T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c2c3dc5285a006b57513e23dfcccd6bfa83e9f62c736b56501d1e27f7df3ca8","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T08:50:27.871886Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.23173/citation-record","integrity":"/paper/2604.23173/integrity","json":"/paper/2604.23173/citation-record.json","paper":"/paper/2604.23173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https : / / github","venue":null,"work_id":"c1d03e36-c4d8-4ab8-b9be-fefd92d12a35","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:a71159e2604b622849ed653ae14d45d70d1a30a80e74765471079f6373c31e94","observation_id":"b5fd60d4-5da1-42ae-b3e7-634e9d122bfd","resolution":{"observed_at":"2026-05-26T16:38:03.112354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","venue":null,"work_id":"61c3b3ad-9022-4379-af9c-923fe4092548","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d9e05c640649b3d4f446b311cc95213c24c124146f464f9eb6176fca0c9211bc","observation_id":"e9b4570f-374a-49b7-92d7-b5057b6746cb","resolution":{"observed_at":"2026-05-26T16:38:03.040721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in Time: A Joint Video and Image Encoder for End- to-End Retrieval","venue":null,"work_id":"cb7b62ac-d3ea-41a0-883c-ade2daf8a4e0","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:bdbb323cf76e97bea6b160623c4b3b436f1c9a758cf6623399bf7360acaf70e7","observation_id":"1c8cdd0e-be70-4ef3-a57f-28475efef9e0","resolution":{"observed_at":"2026-05-26T16:38:03.089947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XMem++: Production-Level Video Segmentation from Few Annotated Frames","venue":null,"work_id":"64703dd2-a50c-44a6-9fe5-f9d8eb566cf0","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:c479c6289e40f2860cf96bcf03ef44862db114650ac3cb1a566c0fdefd3c383b","observation_id":"f26f2c02-c9c7-4403-8da3-743bb2554930","resolution":{"observed_at":"2026-05-26T16:38:03.095209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Corefer- ence Resolution through a Seq2Seq Transition-Based System","venue":null,"work_id":"0c33b1a6-02f6-4edc-9ad8-ba37c6e178e1","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:fbb7aca061de4491f76f6adc3c201decb4feefc9e00f300eb3824b48536b45c0","observation_id":"6759dafd-8868-4720-a536-791728ff7481","resolution":{"observed_at":"2026-05-26T16:38:03.043072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","venue":null,"work_id":"054dcfbd-a87f-45a1-a0a5-47d6cf5022ff","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:94623014f6fbe5709b514e3af9325962957038e2d8838e85a87fba24405ddc42","observation_id":"01b4c86a-3986-4123-8c92-63e253b13e1c","resolution":{"observed_at":"2026-05-26T16:38:03.052519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint Multimedia Event Extraction from Video and Article","venue":null,"work_id":"812898f6-6905-465a-b86a-ffe26db157bb","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d25a48b1e2261cdcb7bd87cfb08642f57b92b37beca30ee8f8e820e19f673540","observation_id":"c71bc4cd-8fde-46c5-a55c-0526d8728d55","resolution":{"observed_at":"2026-05-26T16:38:03.228888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d9b0482b091df36516d908fd70347d53e2d1fb278ebdb5ae3a170bd87b6faaed","observation_id":"7eebcc19-a9c6-4642-b3ee-d7820a122961","resolution":{"observed_at":"2026-05-12T15:52:36.167809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ShareGPT4Video: Improving Video Understand- ing and Generation with Better Captions","venue":null,"work_id":"63a8401f-2ec1-450f-9583-1d3528b1c5d0","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:e1108fa6c3af64e997ad8feef6f3403ebd948f81feee1168516c9666a46531bf","observation_id":"767e1352-4543-45af-b6e0-64216e8d3dde","resolution":{"observed_at":"2026-05-26T16:38:03.144911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V AST: A Vision-Audio- Subtitle-Text Omni-Modality Foundation Model and Dataset","venue":null,"work_id":"e2e0def5-ff29-483c-aca5-8d7db0889f87","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:93cd71c65036684a72bd6b1e0db8fa1541e081796a6a0b80da85e68f1c446b7c","observation_id":"38d54ce3-335a-452d-9fb3-7ef616a232c9","resolution":{"observed_at":"2026-05-26T16:38:03.177079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XMem: Long- Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","venue":null,"work_id":"1c001cec-59bc-4078-8d14-dc4dbc0b722f","year":2022},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:cef97ca4cc43e35c116d4709b2ea4e4eeec7fd8e367126a6e1eb1ab0a5a6e6be","observation_id":"f02f9336-0ece-4db3-967b-0c49fc8fd30b","resolution":{"observed_at":"2026-05-26T16:38:03.191903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:23351b8cd188249db8e85268b00e9ad6fe837d3ba2445844f34b9190898d3e41","observation_id":"119424ae-d507-4a02-a73c-9eb699106c1d","resolution":{"observed_at":"2026-05-11T20:31:11.807561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-Shot Video Question Answering with Procedural Programs","venue":null,"work_id":"7c0ce79b-6db0-480b-8b3e-2783cf65a897","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:31b47ff5abb2ecfc870fc41fd4f8aab19822fb2c9223fa33b9153a35eb16bdf1","observation_id":"3fae2782-2031-47a0-835c-4875430e5a47","resolution":{"observed_at":"2026-05-26T16:38:03.114933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Word-Level Coreference Resolu- tion","venue":null,"work_id":"878263f6-f9dc-4585-a5f5-22474bf92764","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:520ac8cb9e1a80752969afe2bc3011ec4c985d31b59a9ba05f06b795c1e446ee","observation_id":"ebe15fdc-e2b7-4bc7-8045-685d8c28d27f","resolution":{"observed_at":"2026-05-26T16:38:03.111336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DAPS: Deep Action Proposals for Action Understanding","venue":null,"work_id":"e1f9c7a2-a2f8-4047-af32-2ed4ed9ff248","year":2016},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:9e69e526912ac11b09990e177d8550ab12e534f74b4dfaf83f61839261a99d1d","observation_id":"214f6afe-4e1a-42f3-a79b-c9e0099d7b46","resolution":{"observed_at":"2026-05-26T16:38:03.120838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SlowFast Networks for Video Recognition","venue":null,"work_id":"09e21f15-db5e-4e84-aaaf-c3a0fa04613f","year":2019},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:b466784784a0e4c5ac735ace6d1e88201b83e09d1c2d848049694787f76c5da6","observation_id":"67dc4c8f-9d1e-4c53-8e4b-20ee3b7e09ca","resolution":{"observed_at":"2026-05-26T16:38:03.189019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video Action Transformer Network","venue":null,"work_id":"9ce60430-d53d-4e6e-ab48-fcda5b573150","year":2019},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:860e82f5782475f6e68399792ac2a3226c158d6db28b8cbab250d9dfd2ae8415","observation_id":"dee19dc4-5c2e-46f4-bae7-be3e3a394e14","resolution":{"observed_at":"2026-05-26T16:38:03.210833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semi-Supervised Multimodal Coreference Resolution in Im- age Narrations","venue":null,"work_id":"c353ec0f-7ab0-427d-86a2-9c37ce85443f","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:9506f17cef5846b7edb1f524c9ab2191c404cdb272e65ffbe2ab0ed1d14e884a","observation_id":"c27d6c7b-6794-4172-b272-4b384c50cce8","resolution":{"observed_at":"2026-05-26T16:38:03.072751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Who Are You Referring To? Coreference Resolution in Image Narrations","venue":null,"work_id":"b786a9e7-612c-41e4-9eaf-b3d401244750","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:9367276ec976b82b03c316daa4c40e3cb60838b802954f9c618608308d87a2e4","observation_id":"83027b6e-c2ac-4f63-929d-038cb2a6290d","resolution":{"observed_at":"2026-05-26T16:38:03.194936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AGQA: A Benchmark for Compositional Spatio-Temporal Reasoning","venue":null,"work_id":"7a21c079-8ccb-4743-90a6-df9a343e5d68","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:323978792ed46660904f95ab124cbf48c2e6898e4c72ba8c61a32e9a06104e1e","observation_id":"a26fbe97-bf40-4db1-a69d-2b6dddd5469d","resolution":{"observed_at":"2026-05-26T16:38:03.097846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast Temporal Activity Proposals for Efficient De- tection of Human Actions in Untrimmed Videos","venue":null,"work_id":"40181cea-5e82-47ae-bb84-d9254102fdcf","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:46aa1ea99e5ce27c7f8f2e1d964e0ef91e3d92a2d8970c7a023f531f742c87a8","observation_id":"b3fdf8a4-28ef-4508-b572-cfee712e33bd","resolution":{"observed_at":"2026-05-26T16:38:03.100431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VTIMELLM: Empower LLM to Grasp Video Mo- mentsVideo Action Transformer Network","venue":null,"work_id":"f44e687c-0507-4d34-9224-ffc299349172","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:ae4ddf6a5e2ad81dc73a017a4563b893a03ec5741c17f35cd9cf27a7344978dc","observation_id":"8a2ab035-2da3-4b5c-a2ea-b7e55174ded1","resolution":{"observed_at":"2026-05-26T16:38:03.103011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action Genome: Actions as Compositions of Spatio- Temporal Scene Graphs","venue":null,"work_id":"2d2ec656-b403-4cc4-ac38-e779210fefb1","year":2020},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:fec6a7796d6fd80a0b1af3eecf97d0ee3747cfa4eda35cf5ac9ce48e236c08cd","observation_id":"b806f9ed-f97a-4ab1-a9ea-5a112b30d0b0","resolution":{"observed_at":"2026-05-26T16:38:03.153002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ReferItGame: Referring to Objects in Pho- tographs of Natural Scenes","venue":null,"work_id":"00cef7ed-58d9-4db6-8390-85ba6ddc0cc4","year":2014},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:6c07a2675464d8575f1112d24a9a3d1a0070c94e5b541399c17e5bdd54ed90ac","observation_id":"29f8e0d1-3f5a-4d90-9289-3cb86b4cab97","resolution":{"observed_at":"2026-05-26T16:38:03.116560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded Video Situation Recognition","venue":null,"work_id":"539ec824-4b9e-4042-bbe9-3d9b64ce836a","year":2022},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:bcc2f344e141d2d977b351b75446a68cfb6256254c991ea84aada263f1ec7fe6","observation_id":"f6ef0d16-4bc6-46f6-b17e-91e79511920e","resolution":{"observed_at":"2026-05-26T16:38:03.174225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"863a3599-4266-429a-9e58-31cc9befbff1","year":2015},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:7064f8245d8d9a77a166f10b76a3a6aeae4beb0087321422a5f5d0d01ed35338","observation_id":"01e556e0-a124-4720-a4dc-5386ad82038b","resolution":{"observed_at":"2026-05-26T16:38:03.218839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations.International Journal of Computer Vision (IJCV), 123(1):32–73","venue":null,"work_id":"92ff4d49-9ce2-4df0-baf8-cb0f07988a6b","year":2017},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d0d12476f36cc7fed621dafd5221edaafd8d23d93399a46872f10bd302d61149","observation_id":"acc491be-d0f4-4bdb-ae1c-1d5988e66a5a","resolution":{"observed_at":"2026-05-26T16:38:03.223783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SRTube: Video-Language Pre-Training with Action-Centric Video Tube Features and Semantic Role Labeling","venue":null,"work_id":"465588c2-d876-49ec-98a7-6be28f4ca2a1","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:e4610c72dfb1e6284cd111b9306c2bb3fe010410b983d22fca571a185d78f825","observation_id":"8d6ccf2e-2812-4b8d-8ae5-0f470269bbe9","resolution":{"observed_at":"2026-05-26T16:38:03.213746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TVQA: Localized, Compositional Video Question Answering","venue":null,"work_id":"9703f245-221c-4373-b26f-d8165c56685f","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:03fa1c213e543c8809c2394cfb73cb5aa50196f096bc852a8508493ad1229e92","observation_id":"43975666-5855-4df1-a52a-50d1b6998428","resolution":{"observed_at":"2026-05-26T16:38:03.208136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BLIP- 2: Bootstrapping Language-Image Pre-Training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"c8077c09-a895-4735-b1a4-8d72f0262283","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:1d0e1371dc0f3142b4075167cc2fb03fe2bb108d9552662d0cb1ff863f258fe9","observation_id":"b265e963-c916-49a7-bf23-ee5953bf9386","resolution":{"observed_at":"2026-05-26T16:38:03.087310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VILA: On Pre-training for Visual Language Models","venue":null,"work_id":"7ac464be-39ce-46f2-a904-1e7d62c3d448","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:87b0177e8d40f3c9e574b9f75b56ec2b8665ff1a8a6fe0304840cf0e77b1ce9d","observation_id":"928ae01a-504a-4a23-b085-ae0cc28929cb","resolution":{"observed_at":"2026-05-26T16:38:03.216402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":null,"work_id":"d6ddc79c-2ddc-4da5-a199-f379f84305f3","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:390a4a22834105ebf13a168685a08704e075425e50394cba7834836f77865406","observation_id":"66527e88-d5a1-42a0-8c01-697c15cf6ac1","resolution":{"observed_at":"2026-05-26T16:38:03.150019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HOTA: A Higher Order Metric for Evaluating Multi-Object Tracking","venue":null,"work_id":"6160ece6-2c4f-4e54-a462-cae7d7c7ae45","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:a8da170c29cf946d673e2dda6a94f5f073ad800a811c1b77a620a655d3015ef5","observation_id":"67b043ed-f8c5-443c-b858-eb5a247b522e","resolution":{"observed_at":"2026-05-26T16:38:03.046283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MoMA: Multi-Object Multi-Actor Activity Pars- ing","venue":null,"work_id":"ac2cde21-c681-4bb8-bf61-323600bbe7c8","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:03bcdcac0f87123c579f7a2a7b445ac10b1926b2efc3e3d017b71b88f2f0c000","observation_id":"69887a59-b9d2-4306-98ad-b43f2acfe038","resolution":{"observed_at":"2026-05-26T16:38:03.041164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":null,"work_id":"89685d51-6340-496b-ac68-365c3e115342","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:02e0e0536e5ee6eeff4f935df2d3a8021b1bf26f8449adc63256bac95b62f2f8","observation_id":"7c01aaa3-64fa-4af2-934a-7604b493ac9e","resolution":{"observed_at":"2026-05-26T16:38:03.055258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Major Entity Identification: A Generalizable Alternative to Coreference Resolution","venue":null,"work_id":"20882a15-de8f-43fa-b9e6-1d184768c9a2","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:583dc938b7478fbc5bc08eb278399d866dc0481511e43edb6407d04e581bc3b9","observation_id":"c2927b7c-2082-4279-859d-a7d2ccf2b0a4","resolution":{"observed_at":"2026-05-26T16:38:03.144347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.203105Z","title":"Open-o3 video: Grounded video reasoning with explicit spatio-temporal evidence","venue":null,"work_id":"fb25eed0-9409-44e6-af47-191ebb595de1","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:f090561de3dbede09c9b18e9eac02ed77ef6e1a50ec1434b52674c22b111c6d7","observation_id":"a5fe1333-ec10-42ea-8935-3cdc449df7de","resolution":{"observed_at":"2026-05-11T20:31:11.798761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","venue":null,"work_id":"5836522d-a9f3-4569-aacd-ea4dd0086f67","year":2019},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:8183c2156eaf3a0748c5aa05288dad3b49243c28f9279f2e0f3f9ecf65cc3cb0","observation_id":"92fa1bf3-ae89-4bbe-b20a-e9b5c90b7aaf","resolution":{"observed_at":"2026-05-26T16:38:03.104511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Which Coref- erence Evaluation Metric Do You Trust? A Proposal for a Link-Based Entity Aware Metric","venue":null,"work_id":"2ab840af-bfe7-4fa1-bf31-d74411c8ee83","year":2016},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:11f3302fbafacae2ec255ebff51727a27c55fdc043420b32c398fe095bec90f6","observation_id":"4b3e6cc8-b14e-4638-8b36-cfec3d5b77ee","resolution":{"observed_at":"2026-05-26T16:38:03.064126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoGLAMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos","venue":null,"work_id":"61afceba-33e7-45d1-802d-f72a9e94a401","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:ab4ac3353d12a41b5b64f100688f1a550fcbea032b64a28e73f1beb91e6fcbc6","observation_id":"0ed80c0f-0db6-4f7b-9034-77b733219f79","resolution":{"observed_at":"2026-05-26T16:38:03.200371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13435","last_updated":"2023-12-13T17:24:10Z","snapshot_observed_at":"2026-07-06T16:51:06.781541Z","submitted_at":"2023-11-22T14:48:30Z","title":"PG-Video-LLaVA: Pixel Grounding Large Video-Language Models","version":2},"cited_work":{"arxiv_id":"2311.13435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13435","snapshot_observed_at":"2026-06-28T19:22:34.433487Z","title":"Pg-video-llava: Pixel grounding large video-language models","venue":null,"work_id":"d3e76033-493a-4877-96aa-223793394c52","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2311.13435","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:4f6ad91af2b1f36f181204e2154ca3f3bfebbe130f4ef33f9c758d8d4bb01f6a","observation_id":"36ca9cc9-1f11-4485-b37d-b63476214d6a","resolution":{"observed_at":"2026-05-11T20:31:11.774123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video Understanding","venue":null,"work_id":"7f39b6ed-59f6-4f3b-bbec-61672a222871","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:db3f005aefb3ac6b7cfd640162f71819f53a4fcb4592f5add9420701f8f9fea9","observation_id":"f8c1142b-96fd-47f9-b722-c0084bee742b","resolution":{"observed_at":"2026-05-26T16:38:03.221537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identity- Aware Multi-Sentence Video Description","venue":null,"work_id":"ee4065f8-b69b-4a92-b1bf-561ecb360c2a","year":2020},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:914e1486c400a39d6448a86ba84b53dc289617057a8e70f843bb734f01f21240","observation_id":"2dc87950-735b-4c4f-bdaa-b080e31da4e5","resolution":{"observed_at":"2026-05-26T16:38:03.162427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":null,"work_id":"00603cd9-0b3a-4b80-b25c-451f1609bdac","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:a384eb44fa1d01d8e2911ad8069099acd4fd6256757e434538dd234392a159a8","observation_id":"2b1db321-013e-4e36-9cdc-b0edfb449562","resolution":{"observed_at":"2026-05-26T16:38:03.096433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution.Blog post: https://qwenlm.github.io/blog/qwen2.5-vl/","venue":null,"work_id":"a7d83784-5e35-4b90-8419-29270ddf851f","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:f886a76516dd6bff89b8a677453ea87fa8268b84491b54d0dcce3f06eacd7a46","observation_id":"0bc7ec90-94c3-40f7-9da5-038858828236","resolution":{"observed_at":"2026-05-26T16:38:03.156059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MICAP: A Unified Model for Identity- Aware Movie Descriptions","venue":null,"work_id":"d65cb4b9-3df3-4dcf-8f2e-3fef4a4bfe31","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:8fa8ebb5951a9985c51004df00e7874554c0966f45d60c629a66a7271418b211","observation_id":"e2e9ac69-14a1-427a-931c-a120ccb61b2d","resolution":{"observed_at":"2026-05-26T16:38:03.159750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:237484515f4079c041b17e4507de0105245640aadd06b26838b9d103a8cf85b3","observation_id":"e8da2b91-4671-4350-9274-29708ceac499","resolution":{"observed_at":"2026-05-11T20:31:11.818680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","venue":null,"work_id":"a158d4b9-b725-43c7-89b3-9196590d65e5","year":2015},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:c915617b28a19a703f68c7bc1cd06bc0cf2c8cc873b359af69f747aa2b261510","observation_id":"a0f4996a-2bc4-4385-bc85-a3f65f7ea9c0","resolution":{"observed_at":"2026-05-26T16:38:03.165410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movie Description.International Journal of Computer Vision (IJCV), 123:94–120","venue":null,"work_id":"e7c620f7-749a-4de8-8340-a5fc69069d77","year":2017},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d1c5e49a604fec9738ef14f69b04b0c6e82e75c9164b77706dbdfdcf63bf2255","observation_id":"f8d5395d-b575-43d2-a51a-a43a152573ed","resolution":{"observed_at":"2026-05-26T16:38:03.183419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video Object Grounding using Semantic Roles in Language Description","venue":null,"work_id":"1b76a71b-03e4-4740-a7c0-5fbd5aba0a3a","year":2020},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:3e0f5cb1baad751b2ca21a792d790051f384515358af97d0313651cdf9afdec3","observation_id":"c19619df-c08c-447f-a8a3-ff06349cf4ee","resolution":{"observed_at":"2026-05-26T16:38:03.106875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Semantic Role Labeling for Video Understanding","venue":null,"work_id":"554aa2af-a252-4d2d-b782-b9f0b8d0557a","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:415f5c937f058f8b7f2c9f1aeee62633abd8bc157056f50f2e913502eb6d96d3","observation_id":"b2ca91a1-1a68-4777-8b50-07714d9f30cc","resolution":{"observed_at":"2026-05-26T16:38:03.109259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VELOC- ITI: Can Video-Language Models Bind Semantic Concepts through Time? InConference on Computer Vision and Pat- tern Recognition (CVPR)","venue":null,"work_id":"1be6d693-e577-4ffd-b276-96a92345ba32","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:00db019765b8f90e0a1a63af29c636e1412bcedb09c8ea1464db39e0b46d61f4","observation_id":"5846eb1d-9e95-412a-bfd5-a1708b1008ab","resolution":{"observed_at":"2026-05-26T16:38:03.139359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effi- cient Parameter-Free Clustering Using First Neighbor Rela- tions","venue":null,"work_id":"d8e9b0f1-7318-48af-923d-09620984bc81","year":2019},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:18ec112da6f977f0eaad231dbc34b61edc50ad2008c3b8432c0c3abc6d180f8b","observation_id":"3ea43469-2cba-4504-9be5-d34441bf71e1","resolution":{"observed_at":"2026-05-26T16:38:03.231552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-End Generative Pretraining for Multimodal Video Captioning","venue":null,"work_id":"724d6eeb-ff13-4027-8a39-9b737c8b243e","year":2022},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d23bee9fa92a6839ae9f18d3fa143fbf833ce783a967913645f0db773904e31a","observation_id":"e06e8275-7c63-4537-a501-26f0eb69d98c","resolution":{"observed_at":"2026-05-26T16:38:03.136578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal Action Localization in Untrimmed Videos via Multi-Stage CNNs","venue":null,"work_id":"1c551f96-135c-4625-b126-cafef7d0ad78","year":2016},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:3e21dc404962768238643b5c7bdea39fbc2deb8214e986a329587f31882b9dd2","observation_id":"196b3e67-4de3-459c-adf2-537168ee7409","resolution":{"observed_at":"2026-05-26T16:38:03.142355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actor-Centric Relation Network","venue":null,"work_id":"e969992a-058b-4580-aa36-6f63d74a8d9b","year":2018},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:ab04c14e2967c6db194902a2812d2f014aa8151a1030f47c2d7fba59c8d37350","observation_id":"2d72c2cb-3914-404a-bdbb-35176f7b7336","resolution":{"observed_at":"2026-05-26T16:38:03.147302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unbiased Scene Graph Generation from Biased Training","venue":null,"work_id":"281ad06f-188e-4b88-a7f1-67440f82a728","year":2020},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:3c44163dec21a2fde71497bd4cf81e7c396698aecc035f2667808180a5cd52a8","observation_id":"cb637cd7-02cf-4ebb-ab84-343549e88ac6","resolution":{"observed_at":"2026-05-26T16:38:03.171773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long Term Spatio-Temporal Modeling for Action Detection.Com- puter Vision and Image Understanding (CVIU), 210","venue":null,"work_id":"32a791f7-3eaa-4b69-b0f0-64f126be5e03","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:6ded76c4b5ad203e4db94a9512c667403ceae2f50f2e48adfc73490f2ceceb5e","observation_id":"7671a9fc-1460-457d-815a-24df8c021001","resolution":{"observed_at":"2026-05-26T16:38:03.180029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MovieQA: Un- derstanding Stories in Movies through Question-Answering","venue":null,"work_id":"5cea5cf5-7e8b-43ba-9232-03f1490f9cd4","year":2016},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:43b1edaeddf7d9e519b574a9a15a13c2bdbdcc040906cfab92d44ca11173999b","observation_id":"39124621-bd7d-405d-ac3f-12aa3f6ce112","resolution":{"observed_at":"2026-05-26T16:38:03.133405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On Generalization in Coref- erence Resolution","venue":null,"work_id":"5b39a12d-bc89-4141-9511-7f757d490001","year":2021},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:43169f647b0355702d3ce9233eea6cd4e5b7763f1893103429b6100d437ca52b","observation_id":"1e6903fd-efce-4b99-a116-d85e7b869e96","resolution":{"observed_at":"2026-05-26T16:38:03.130095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:51b29170d472cb9d698010ecd9a4470d1f3c5a022e3166e8d405b8be61f5ff62","observation_id":"1cd80ef2-6eb8-4843-baea-d03e5eeb964f","resolution":{"observed_at":"2026-05-11T20:31:11.788353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"a274a419-daae-4f2a-9e29-dd3dffaf1010","year":2015},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:b667d4e6593c200867d44f6a4603377cbaf680703d0034b2a617f8910546ede3","observation_id":"31aa72e1-dd44-4e54-9546-29c6c840f21d","resolution":{"observed_at":"2026-05-26T16:38:03.168728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effec- tively Leveraging CLIP for Generating Situational Summaries of Images and Videos.IJCV","venue":null,"work_id":"c4561c29-3cdf-479a-a4c6-4c36f3fc6c46","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:4105b180ec4fd8d9c252ee880c430c269d06b8b9f9fdd07c0187c877e2a8da3f","observation_id":"fe71fc0c-9156-40a5-b457-f4f455bc76f8","resolution":{"observed_at":"2026-05-26T16:38:03.035037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MovieGraphs: Towards Understanding Human-Centric Situations from Videos","venue":null,"work_id":"b3caae8b-e35a-4575-872c-898e3a78161d","year":2018},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:8e1286768fb676c9652645a18fc85d74bb694e32fd21f43395851c9f50717bb9","observation_id":"30d3bcc8-0f56-4fc2-a711-ed08d1fcfa21","resolution":{"observed_at":"2026-05-26T16:38:03.117798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.07465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:39:59.453061Z","title":"Yoloe: Real-time seeing anything","venue":null,"work_id":"a0e33ede-c407-42a2-ba32-cf37d849c193","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:795bd46f9c7a8384050c39c8983e1f48c5616d303ce085894efe517970c55c33","observation_id":"e1fe5fc1-dec3-463a-bbc3-86db0d6b851e","resolution":{"observed_at":"2026-05-11T20:31:11.863762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recog- nition","venue":null,"work_id":"5991e47b-f8d8-44ea-bbc1-696f604ca93b","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:a1b97c7975a422a5d0c116aa12d4858af54253267a2bad8829a1dd1405940f54","observation_id":"6d63972a-4b40-421f-b0e7-c2224d9c66b8","resolution":{"observed_at":"2026-05-26T16:38:03.099365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:00d35a2fc3dd04d413371997b6737859a05932b148e7463e70a972afbecd0ce6","observation_id":"a65125e1-11c6-4ed3-9600-e173705ebcfc","resolution":{"observed_at":"2026-05-11T20:31:11.871197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Demonstration Meets Typed Events: Type Specific Video Semantic Role Labeling via Multimodal Prompting and Retrieval","venue":null,"work_id":"128dc151-f110-42af-b627-6632b806e2d4","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:a2962aae9b930e075616ff505764d9bc4a7f6d7ad978f73a553f041cd94a6268","observation_id":"9241731f-8b22-4df2-9138-2d8297dd70bf","resolution":{"observed_at":"2026-05-26T16:38:03.065507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long-Term Feature Banks for Detailed Video Understanding","venue":null,"work_id":"4d4c4626-14c0-4d85-8f1a-9250e316d291","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:5ff8b5cf563f8973e39a3d9cf2e9011c13387654b3b2505b3e76cf3fa7bd6708","observation_id":"64dbb806-2a2a-4201-8e91-4382ba232fee","resolution":{"observed_at":"2026-05-26T16:38:03.137739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MSR-VTT: A Large Video Description Dataset for Bridging Video and Language","venue":null,"work_id":"afc0c8dc-8e83-4ff6-abe6-662ccb2e94cb","year":2016},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:3d6e9c067820c9408d925c4ba44d59844fb8c271d70cd4c6f1af9bfb29b34921","observation_id":"a9ecbf17-778e-45ab-8246-33d12982c418","resolution":{"observed_at":"2026-05-26T16:38:03.197356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TubeDETR: Spatio-Temporal Video Grounding with Transformers","venue":null,"work_id":"e2736abc-86f6-4351-ba5f-90cbb503d2c8","year":2022},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:b66c935058a36cfa4eb5c6ee4b9d753a2666181e099b4032edb5655279d2fd72","observation_id":"7096acac-5063-44bf-9ecc-07f0b7ec918c","resolution":{"observed_at":"2026-05-26T16:38:03.226216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning","venue":null,"work_id":"f84a519f-e3d2-49c4-a0be-aa3d6486d4a9","year":null},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:14b1238dd2ad4c553c5619e29204c638b7ad6f3baccd3ac8c579069a42a89a1f","observation_id":"5bbd514c-21f6-41c5-b99f-4cea37362700","resolution":{"observed_at":"2026-05-26T16:38:03.127454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video Event Extraction via Tracking Vi- sual States of Arguments","venue":null,"work_id":"fa1d1754-e309-44bd-93c0-d3b043ed74ca","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:ddd6305685aae1c953e68c4f213c437efda677af4c2c1643dac4defa78b99afa","observation_id":"cad60622-b58b-412d-a5c3-55d6378a9919","resolution":{"observed_at":"2026-05-26T16:38:03.075574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11968","last_updated":"2023-04-28T03:21:27Z","snapshot_observed_at":"2026-07-06T15:19:13.162460Z","submitted_at":"2023-04-24T10:04:06Z","title":"Track Anything: Segment Anything Meets Videos","version":2},"cited_work":{"arxiv_id":"2304.11968","doi":"10.48550/arxiv.2304.11968","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.11968","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2304.11968 (2023)","venue":"arXiv (Cornell University)","work_id":"4a7361a1-31cd-4688-90bf-f97bbf6f25c7","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2304.11968","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:63a07fea3f462fc2963f55098d1fb272aa6ea9a1b17e48e8fb4e868bc33c9ad9","observation_id":"9f126d71-9aa3-43ad-b798-6358d6c3dcea","resolution":{"observed_at":"2026-05-11T20:31:11.879222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panoptic Video Scene Graph Generation","venue":null,"work_id":"7c5e7e95-514c-45aa-8e87-0591066654f7","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:e7913adc05b12b3468f5197a05ba787b03905ba3996ebd6d0e319861cc6b5ec6","observation_id":"e40233af-9e7f-4d23-9105-e79b645cb135","resolution":{"observed_at":"2026-05-26T16:38:03.202645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:481ca94dce1aa54473a16b3c91fb9294ab1e6b103fd2388b3c0813fb380471d5","observation_id":"aaec3d26-26c8-4d62-a79b-42d8e42aa024","resolution":{"observed_at":"2026-05-11T20:31:11.855018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering","venue":null,"work_id":"b2b2784e-57c8-4e44-9102-a34a65b1b44c","year":2019},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d20d93f0db68fb2984ebe24f357fa9ec96d1c3548aa1771f2357cfc8ab34ea41","observation_id":"16b9b879-28a0-4c3e-a26b-be991b26fbf4","resolution":{"observed_at":"2026-05-26T16:38:03.205362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:290ae7e4cd1e330ed2f56e8fa204180c4f504cb997c8793f983fbc288e5f8430","observation_id":"4cb66a7f-62f9-4bd7-8f8c-178dc392acd6","resolution":{"observed_at":"2026-05-11T20:31:11.828360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaV A-Grounding: Grounded Visual Chat with Large Multimodal Models","venue":null,"work_id":"12c14665-71c6-4acf-a8a3-d36ff4740bef","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:704bb423fa0fb2214133ad4955504ed60aa43fb469a888447c0ca36c3088e0e0","observation_id":"8d83bff7-4fb2-40ed-9611-8d9cfe24d9be","resolution":{"observed_at":"2026-05-26T16:38:03.121152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":"840540d3-292a-4864-a463-4626e6f44d8f","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:f3fddf76552c0860f979cf06e3ed7bee9acee5721caf6d45992fdec0efd74c53","observation_id":"19e2f6b4-8eed-4640-bfb3-39f22eacf6fe","resolution":{"observed_at":"2026-05-26T16:38:03.126405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video instruction tuning with synthetic data.TMLR","venue":null,"work_id":"dda1b0ad-af0b-4d45-b533-d2af4c456260","year":2025},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:d87c852273a03adb363b23454beac607802b87a6b93750a115e661afe927fae9","observation_id":"5536d927-3cea-48a6-84b4-dc3db53c6d52","resolution":{"observed_at":"2026-05-26T16:38:03.123592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constructing Holistic Spatio-Temporal Scene Graph for Video Semantic Role Labeling","venue":null,"work_id":"c32cc1aa-853c-4939-b9f2-accb5d34024b","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:922f1f71053ca3dd266dc762d1547bb609c7009a06b881a053af99ff33eece82","observation_id":"5b809598-985a-4b88-b931-2654ae26cb36","resolution":{"observed_at":"2026-05-26T16:38:03.147600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal Action Detection with 11 Structured Segment Networks","venue":null,"work_id":"580b7155-38f0-42bf-85a9-634e5ed633a5","year":2017},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:2e06a2a35a6bf8309f7041f3f30c6256502346391729ba6f388db124030ef171","observation_id":"74a752a7-0e9b-4890-8f87-9a198f978264","resolution":{"observed_at":"2026-05-26T16:38:03.186159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming Dense Video Captioning","venue":null,"work_id":"7eefb313-388c-474e-9758-def4120e2913","year":2024},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:aec5e0c91821ef15d072492f8c3780ee98665a01a279bce58c6af7da1b66595f","observation_id":"3793d8cc-4406-40a6-adb1-e951abd084ea","resolution":{"observed_at":"2026-05-26T16:38:03.140877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":73},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2604.23173."}