{"as_of":"2026-08-07T19:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb70e0eb8c073da0929dc646a7546182679a00f7d1c50ac902f3f4ae63f3d760","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:45:51.654456Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11155/citation-record","integrity":"/paper/2506.11155/integrity","json":"/paper/2506.11155/citation-record.json","paper":"/paper/2506.11155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.545168Z","title":"The Verifier we used is Qwen2-VL-72B","venue":null,"work_id":"5db9f1de-530e-4064-a377-b44ac8bd8555","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.732140Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:7c40cf55c271749c646d3938076c4aeccf9c5c1f1f6b8dddbd74facfada74117","observation_id":"1c60edfc-0cbb-4f35-89df-1696c8185719","resolution":{"observed_at":"2026-08-07T04:45:52.549246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.532579Z","title":"video caption","venue":null,"work_id":"00391cf7-4596-4ea7-b6c4-f285a47ce123","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.769808Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:277c1ae0ffe381276f95a96b30beb1be86cd5478137c6fdc41812a36f2216d69","observation_id":"d0cb6278-ba63-4b33-bad5-f1403c087f6a","resolution":{"observed_at":"2026-08-07T04:45:52.536479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.490856Z","title":"The defination and examples of each category is described in Figure 10","venue":null,"work_id":"c156b085-3961-4e8c-8cda-0f413f1ea69b","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.897453Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:bf2d3868d94660c3572ff4ac5cc65a4d6eff961f5a301f58734296cd48056c0c","observation_id":"08bb520d-f4a2-4e37-8030-ace8a2b4984e","resolution":{"observed_at":"2026-08-07T04:45:52.494812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.519163Z","title":"As shown in Figure 6, the Nature and Wildlife category has the highest number of videos, reaching 382, while the Arts and Creativity category has the fewest, with 57 videos","venue":null,"work_id":"faf2c1a7-a0ef-4dd4-8014-508b244fbd86","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.807483Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:800a84f827d484ae311f8163b756de1e0e2cb248124a9536f962ddffa60d774c","observation_id":"43c230d3-60b0-4dda-8539-13f547e19a14","resolution":{"observed_at":"2026-08-07T04:45:52.523671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.124124Z","title":"For clarity, consider these examples: ## Example 1 ### Key Points {1","venue":null,"work_id":"433e3ae2-18fa-4e63-979c-3b3f19a86538","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.250419Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:fabb706fefcadb7aa8a8bf8a1a90ceab0a92f6731eda54d5faff00992f0ba847","observation_id":"0edb9973-083d-4661-9ce8-bb956e41b22e","resolution":{"observed_at":"2026-08-07T04:45:52.128104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-07T04:45:49.655855Z","title":"Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.655855Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:58120f1546f209852ac9289667d229f3fdaac5846342b1abfe4930320f93aad6","observation_id":"aca6c052-7370-41b5-9be1-b61b192335c7","resolution":{"observed_at":"2026-08-07T04:45:49.655855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.505798Z","title":null,"venue":null,"work_id":"6c5f007b-7f9e-4840-bb14-026ac79e47d4","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.877197Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:6ca689341a07530666a760b826662a1365dd6574996366e68e670b691d745841","observation_id":"e43c75bc-cef8-466e-b1e4-d6c27ddc085b","resolution":{"observed_at":"2026-08-07T04:45:52.510059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.477952Z","title":"Elaborate on the visual and narrative elements of the video in detail","venue":null,"work_id":"452923d3-f0a6-4f34-9f8a-38897acbd1f4","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.953882Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:bbeea5294dc9d5f0d69c9b61279cf9e51a8ee0b2f3cc6010085de6dda100a736","observation_id":"9128212f-1432-4a17-a791-81d3712fea5c","resolution":{"observed_at":"2026-08-07T04:45:52.482137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.464280Z","title":"Reply to me with a precise yet detailed re- sponse","venue":null,"work_id":"648b04cd-d203-4fdc-936c-2999c564d8ce","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.986135Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:21b0847868680220231edc6e030c58e6dcab415fe3eae8fb1d8b0d4258c0a995","observation_id":"09dc07ac-d317-4bee-b07f-d469fb158832","resolution":{"observed_at":"2026-08-07T04:45:52.468746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.451852Z","title":null,"venue":null,"work_id":"47dd3e50-1e68-48d4-ad00-37ce75e0b62e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.040106Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:3da4694d84c6ee41f0d43099f9f4bd352ba7895f4277fdd7a409812f470b26e6","observation_id":"aa5f7445-cd02-4a89-ade0-b30c3b04a451","resolution":{"observed_at":"2026-08-07T04:45:52.455747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.438336Z","title":"If you are not sure about something, do not include it in you response.\\n # Task\\n Describe the background, characters and the actions in the provided video.\\n”","venue":null,"work_id":"c0650393-250c-4abc-b40d-4e672ffadad3","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.063737Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:7f5f6c8f732b1868dcdc1fcaeaa11cd7f19a2731f28df2be06654978ca3df554","observation_id":"12594294-b8ea-45a0-8d77-a4ea5371fbf2","resolution":{"observed_at":"2026-08-07T04:45:52.442836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.425012Z","title":"Please describe the video in detail","venue":null,"work_id":"40892519-ec57-4fc1-a54c-9ef646f5e0d6","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.091040Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:11d32d0ad0b1ccb28fa1425fb1b7364a6b3851884c12b899fa2b37a369ebc3e8","observation_id":"09a987e6-3a93-4b05-93d3-bd4e4708cb89","resolution":{"observed_at":"2026-08-07T04:45:52.429147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.412914Z","title":null,"venue":null,"work_id":"28d7618b-b808-4573-8b77-50bc07a4af9f","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.113506Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:9d14acbe186d24eb8d52eccce1bf6a562020e95713f83f49ca778d8a362fc376","observation_id":"612c6a12-7820-4ec1-8ee6-5fb423a35600","resolution":{"observed_at":"2026-08-07T04:45:52.416554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.400201Z","title":"Action Description Action description focuses on the specific behavior or activity that takes place in the video","venue":null,"work_id":"d1c0462f-ad94-4f70-b54f-477dbf531e18","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.157246Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:8e764760fc6fbd3dc5f6f96df43b0d804518afbb59b1c9415bc533a01c97c558","observation_id":"8ff35304-bb11-4a01-a8a6-9a32d9b4da57","resolution":{"observed_at":"2026-08-07T04:45:52.404105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.388290Z","title":null,"venue":null,"work_id":"61f2ae0e-e092-4cc9-af31-4f2d683ab043","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.227646Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:9630f1e7fd7bd92fa9654ea75a7d8f9521991f4d03d8bb0c17fca3da35bea65e","observation_id":"5e35b046-e14c-4907-a93c-8cf020039730","resolution":{"observed_at":"2026-08-07T04:45:52.391772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.375804Z","title":"Environment DescriptionEnvironment description covers the background and environmental features of the scene in the video","venue":null,"work_id":"18eaa95d-e801-4895-9574-8ab2208953b8","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.272752Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:f9afb4aece92cdcf0b4faca183fd344dea688b36cf5ed5f2f8f9609d846b0bbb","observation_id":"f6407169-11de-4a84-b3c8-456171823de0","resolution":{"observed_at":"2026-08-07T04:45:52.380039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.363038Z","title":null,"venue":null,"work_id":"2e19088d-5c0c-4dce-bf38-d17151ea854e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.321552Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:696aafb714e6ef8d9a220e0407cb0ae1d28efa4fedd962bd4113ddeeb8a2b0db","observation_id":"0a7688bf-5e33-47dc-8ebd-8049fa3c40e8","resolution":{"observed_at":"2026-08-07T04:45:52.367175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.349948Z","title":"Object Description Describes the features, characteristics, or details of inanimate objects or items present in the scene","venue":null,"work_id":"95591232-3ffa-4c83-840a-d4d8e1adbac1","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.384862Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:2b3077b8f4f5fb416da729bc82059f2cac1edde9725e9624380f4f703377d180","observation_id":"1c4f6e0d-c3a7-4497-a5f7-082058f8b5ac","resolution":{"observed_at":"2026-08-07T04:45:52.353915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.336366Z","title":null,"venue":null,"work_id":"4ec956df-6c53-4156-a06f-68856ea9c4c9","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.433451Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:842a8e3e58faf2bb6b09bc7e0b3ef17b48e1bb622ea05e62f9e6afe14eb1ce20","observation_id":"36aad59d-79c6-4bef-9b3c-afc83c6f062f","resolution":{"observed_at":"2026-08-07T04:45:52.340986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.322330Z","title":"Camera Movement Describes the camera angles, movements, framing, or other cinematographic techniques used in the scene","venue":null,"work_id":"2fd34523-2514-4e77-835b-73bc5dddc790","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.493367Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:e2705a41d09cc604288673432a00d8bb924c4c15cf0b6d5599f0c990ce58b7e0","observation_id":"e9a41f06-b236-4622-b32f-2204c25f501c","resolution":{"observed_at":"2026-08-07T04:45:52.327006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.308703Z","title":"Overall Description","venue":null,"work_id":"55c8fa73-e161-422b-8d09-d4bf22e5b05e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.556622Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:de9e980ef808ff520d491c3455c03b333584416d6db6406f3301671f21e72632","observation_id":"6d106cb3-23e4-4936-81ab-e38ff7579a41","resolution":{"observed_at":"2026-08-07T04:45:52.312951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.296136Z","title":null,"venue":null,"work_id":"3542a155-5be3-4c09-ba89-613f504a4cba","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.602919Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:d3d9943d5d7695d54cd9e523fe8543a24bd2d10cf8ad3c7757118e03f899fb95","observation_id":"e2c286b5-8623-4035-8ed6-1564be95773f","resolution":{"observed_at":"2026-08-07T04:45:52.299776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.283717Z","title":null,"venue":null,"work_id":"329aa8c1-897f-46b7-ae5a-98d8964e7d4d","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.648467Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:a556f3b23e8d92c8342d6fdd8ef2ada9305bb4364e06022fb53f3d255b8da4b9","observation_id":"44daad0e-240f-45f7-a52a-fefdb635de9b","resolution":{"observed_at":"2026-08-07T04:45:52.287434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.268949Z","title":null,"venue":null,"work_id":"e4f7e9b4-dc71-4250-aa48-3d206f314959","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.685906Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:949c6c49c868cdafdc12da8e610bfbe1c30265095938d4afc481a5b1fa22ec15","observation_id":"207efaf8-4853-479b-b148-e0c90cf7d968","resolution":{"observed_at":"2026-08-07T04:45:52.273193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.255216Z","title":"Judgment: [yes/no] Reason: [Brief explanation]","venue":null,"work_id":"2d48f047-35f0-42c7-9b12-c09231ee9de7","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.709361Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:2af400522424e82374d2372881b9367b2d570243c0c86295493bcfd4a888ee48","observation_id":"5a01bb6c-ea31-42a4-b312-5f45cfd4fdf3","resolution":{"observed_at":"2026-08-07T04:45:52.259294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.242266Z","title":null,"venue":null,"work_id":"4ea08a4f-cadb-4992-b902-6c71acbfa2a5","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.751336Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:c2955d0f22ed344423785427433ccbc7dbe4c4638bf6f59abdf834bc75c97cbd","observation_id":"e7a52ff5-1705-41f0-bb08-4f714e14fd67","resolution":{"observed_at":"2026-08-07T04:45:52.246129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.229125Z","title":"For clarity, consider these examples: ## Example 1 ### Video Description: The video showcases","venue":null,"work_id":"ea6be8a4-473d-4be3-a61e-efa9e8f4fbb9","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.820854Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:d6224122bd7ddacbb548577b3e42876630244c51ee86b8fed0740dc69a6824af","observation_id":"73134215-1d39-4897-8815-04b2c4f43b6b","resolution":{"observed_at":"2026-08-07T04:45:52.233155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.214913Z","title":"entailment","venue":null,"work_id":"017b3d59-4c26-435e-9ecf-3931c8e4e14e","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.866840Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:a60eed40393480c9b3957b45bdb7f60b4b258fb544e18d693ce133c964bed950","observation_id":"44eec224-6230-442b-a74a-18647b9d08b2","resolution":{"observed_at":"2026-08-07T04:45:52.219323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.200657Z","title":"contradiction","venue":null,"work_id":"da5ec721-624c-401c-b833-7febbcacfbf6","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.920062Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:44be990e8d2cf51c7536089d217d73da59571358fe10ef0dd394e9d31afdad29","observation_id":"e3a218d6-bbb0-476d-936c-c61e9096d38d","resolution":{"observed_at":"2026-08-07T04:45:52.204952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.187795Z","title":"neutral","venue":null,"work_id":"79dcd76c-d38a-4827-ae98-9838b94e29ad","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:50.988196Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:32b36722e3e261cd841b009df52e15e27cda7af36ed374230a1ab5676e857f63","observation_id":"deaf138a-b65f-4a5b-bfd3-379f268f0095","resolution":{"observed_at":"2026-08-07T04:45:52.191475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.175357Z","title":null,"venue":null,"work_id":"4c9f2b6e-2009-4277-b323-678d8617d5de","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.039572Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:73c7e51e7f253af9bca895d3706fb5687ca7115acc1fc95fa73af18738c7cbb3","observation_id":"f04dc7e4-f631-4893-888d-c690782b4841","resolution":{"observed_at":"2026-08-07T04:45:52.179059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.162683Z","title":null,"venue":null,"work_id":"b8669745-a1c0-434a-8a3e-6f69d746f132","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.135838Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:dd760e615e6e99bad3762394e84a26dca58c81bc6d775001822c04253696b9e5","observation_id":"2dead321-8060-4d48-b8fe-099d903d3c0e","resolution":{"observed_at":"2026-08-07T04:45:52.166708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.150188Z","title":null,"venue":null,"work_id":"81e97538-ead2-4723-be53-062e652987c0","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.205648Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:45e2fcea8053c8f80fff0ce91cb49688157e888632f3ef4c4b671622436c583a","observation_id":"bc4c0a8c-5d0a-4cda-b690-413ff0c6f458","resolution":{"observed_at":"2026-08-07T04:45:52.153967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.137624Z","title":null,"venue":null,"work_id":"1e36491e-1950-49b9-83fc-09e383d23377","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.226275Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:9c06edd4b917b8374e429dcbbb9e35a1706a0bf56c4e7b16a9e913e7154eba10","observation_id":"6f322406-4ade-4809-85c7-01a3c1c5245d","resolution":{"observed_at":"2026-08-07T04:45:52.141384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.110759Z","title":"[No] Speculative","venue":null,"work_id":"b3c98dab-caea-48b9-a9bc-bea4780ae513","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.286328Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:04bbe3a3988ef8a657375a494b9b8116583bc35c5e5bc6afd0282ac69caa5e4c","observation_id":"209f6f20-0529-436b-bd45-60bbf283b7a3","resolution":{"observed_at":"2026-08-07T04:45:52.114620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.096400Z","title":"</thought> tags","venue":null,"work_id":"770e729e-aea5-44bc-870f-61fe08740999","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.329282Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:9cd59db3c31ca7af3ccf4ab456cd01b941c78a491a1b11f46dc9652d44bdc41d","observation_id":"4e58d046-f8ca-40fd-94a3-9631b7ad3b35","resolution":{"observed_at":"2026-08-07T04:45:52.101011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.082289Z","title":"Overall Description","venue":null,"work_id":"50c69f39-b842-48a5-8c60-98adba71d87f","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.449655Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:ae69047c52e158ec355d8b6f7e0ca1b65504aa2962b8f28f2faec25ced626ba7","observation_id":"440f3780-deb9-417e-923a-65bd5d676425","resolution":{"observed_at":"2026-08-07T04:45:52.086183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.068402Z","title":"## Example Input and Output: ### Input: Overall Description: {overall_description} Observation: Vehicles Key Point: There is no existence of any vehicles in the video","venue":null,"work_id":"e7793373-d93f-449e-9a15-58e8846f7535","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.496957Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:a99d78f3fa7675e15325f4eaea61231e427c8a8d60cedc132a839a5ad40f330c","observation_id":"ae45ca9a-7395-467c-9248-59acb4d784ae","resolution":{"observed_at":"2026-08-07T04:45:52.072730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.055236Z","title":null,"venue":null,"work_id":"07d0ed50-2b31-4c3f-a840-3962e1211981","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.561541Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:b344f6ee53654ad3233ad5bab9a4e903902b363a67319d947d88d9bd6da7082a","observation_id":"ba2e7ca2-4f59-4f63-a9b4-b4249dfbf04d","resolution":{"observed_at":"2026-08-07T04:45:52.059285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:52.020891Z","title":null,"venue":null,"work_id":"dfa38569-2632-4c4e-bdd7-9eea27fcc1ae","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.625504Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:666cb8ed3ee3eeb05c2ee7338d533e160f65044b5848ca80bc98febfaa5c2b18","observation_id":"943bbb7a-b0a6-4ed1-97dc-7efff2e687fe","resolution":{"observed_at":"2026-08-07T04:45:52.045858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:45:51.937413Z","title":"Precision / Recall / F1 Score","venue":null,"work_id":"9c9d2622-9c67-4b59-93a3-7f4459e08652","year":null},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:51.654456Z"},"links":{"citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:c766b093197dfe50b0ab5be8cfc68afcecf2fcfe3d1c4e16aee7628a1fe69d8f","observation_id":"5cd90b8e-b737-4cb4-9a01-69db871d2438","resolution":{"observed_at":"2026-08-07T04:45:51.968280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04752","last_updated":"2024-06-07T08:52:24Z","snapshot_observed_at":"2026-08-05T22:09:34.368887Z","submitted_at":"2024-06-07T08:52:24Z","title":"CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.04752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04752","snapshot_observed_at":"2026-08-07T04:45:51.798794Z","title":"CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models","venue":"cs.CL","work_id":"92d94ded-350f-4990-b419-ac68ec223db2","year":2024},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.548866Z"},"links":{"cited_paper":"/paper/2406.04752","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:148186bef7a378f9f3e256a890df3a3259257b27dcf774995e55d15d42f37c7f","observation_id":"91c77bd8-51be-499e-a1b7-18721181226a","resolution":{"observed_at":"2026-08-07T04:45:51.840389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T04:45:49.431685Z","title":"In Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.431685Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:b0f9784e7b7ec0e0675cd12595045a6712423478947ae275614c3e63188f6a4b","observation_id":"8cc72c16-a1b7-44d9-ba64-53bcd81e4d9c","resolution":{"observed_at":"2026-08-07T04:45:49.431685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15422","last_updated":"2024-03-04T16:55:15Z","snapshot_observed_at":"2026-08-03T13:07:34.950878Z","submitted_at":"2024-01-27T14:19:33Z","title":"A Survey on Data Augmentation in Large Model Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15422","snapshot_observed_at":"2026-08-07T04:45:49.695413Z","title":"Please describe the video in detail","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.695413Z"},"links":{"cited_paper":"/paper/2401.15422","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:db376799889d87a2cb5f2b47be5e4b45e1406beff9f71f858529e83395062750","observation_id":"8b0c2260-b588-4876-b0f3-809ab39e684f","resolution":{"observed_at":"2026-08-07T04:45:49.695413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13007","last_updated":"2023-03-20T11:39:47Z","snapshot_observed_at":"2026-07-06T14:55:41.638936Z","submitted_at":"2023-02-25T06:58:16Z","title":"AugGPT: Leveraging ChatGPT for Text Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13007","snapshot_observed_at":"2026-08-07T04:45:49.338985Z","title":"arXiv preprint abs:2302.13007","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.338985Z"},"links":{"cited_paper":"/paper/2302.13007","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:aa30312b67487999d4564ebf9cac38c3a7e9cbad6ea5095fd0ba59cf3fa87bbc","observation_id":"d31a7ef3-db04-4ac8-b77b-04a581e6beb3","resolution":{"observed_at":"2026-08-07T04:45:49.338985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T04:45:49.619619Z","title":"arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.619619Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:e420d0ad444091eab4dcc1556a16a05e36c017badb043b30f3932cd174ee328e","observation_id":"ad3cbeba-4fda-4f83-bb7d-6c5ec7d0dd94","resolution":{"observed_at":"2026-08-07T04:45:49.619619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03884","last_updated":"2026-06-03T08:00:13Z","snapshot_observed_at":"2026-08-05T23:18:17.400072Z","submitted_at":"2024-07-04T12:23:02Z","title":"ChatSOP: An SOP-Guided MCTS Planning Framework for Controllable LLM Dialogue Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03884","snapshot_observed_at":"2026-08-07T04:45:49.470142Z","title":"Preprint, arXiv:2407.03884","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:49.470142Z"},"links":{"cited_paper":"/paper/2407.03884","citing_paper":"/paper/2506.11155"},"observation_digest":"sha256:aef9d81ce25e253f97ced6fa02512c9fe0d0867e8b01a334fd8f29b7fb78e6f7","observation_id":"0b957b4d-0f0a-4132-b5a7-232ce234c2fb","resolution":{"observed_at":"2026-08-07T04:45:49.470142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11155","last_updated":"2025-06-11T15:11:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:36:58.955244Z","submitted_at":"2025-06-11T15:11:37Z","title":"Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.11155."}