ฉันให้ ChatGPT, Claude และ NotebookLM เป็น PDF 100 หน้าเหมือนกัน – นี่คือใครที่คิดออก

0
ฉันให้ ChatGPT, Claude และ NotebookLM เป็น PDF 100 หน้าเหมือนกัน – นี่คือใครที่คิดออก


ฉันได้ลองใช้เครื่องมือ AI มานับไม่ถ้วนและพบว่ามีการบรรยายสรุปนับล้านครั้ง ณ จุดนี้ และสิ่งที่ฉันกลับมาคือกรณีการใช้งาน AI เพียงไม่กี่กรณีที่ออกแบบมาสำหรับคนทั่วไป เราได้รับการแสดงตัวแทนอย่างต่อเนื่องที่สามารถบูรณาการขั้นตอนการทำงานที่สมบูรณ์ โมเดลที่สามารถเขียนฐานโค้ดทั้งหมด และคุณสมบัติเฉพาะที่เพิ่มขึ้นซึ่งฟังดูน่าประทับใจเมื่อแสดง แต่ไม่จำเป็นว่าเป็นสิ่งที่คนส่วนใหญ่ต้องการ

กรณีการใช้งานอย่างหนึ่งที่ฉันไม่เคยรู้สึกอยากทำมาก่อนก็คือการจัดทำเอกสาร มอบ PDF ที่ยาวจนน่าขันให้กับ AI ถามคำถามสองสามข้อ แล้วมันจะตอบสนองสิ่งที่คุณต้องการ นี่คือสิ่งที่ฉันสามารถจินตนาการได้ว่าใครๆ ก็พบว่ามีประโยชน์ NotebookLM เป็นเครื่องมือที่ฉันชื่นชอบในกรณีนี้ แต่ ChatGPT และ Claude ก็ทำงานได้ดีกว่ามากในการทำงานกับเอกสารขนาดยาว

ดังนั้นฉันจึงตัดสินใจให้พวกเขาทดสอบโดยให้ ChatGPT, Claude และ NotebookLM มีเอกสารมากกว่า 100 หน้าเหมือนกัน

ฉันลองทั้งสามรายการด้วยเอกสารและคำถามเดียวกัน

PDF เดียวกัน คำถามเดียวกัน ไม่มีข้อแก้ตัว

ฉันให้ ChatGPT, Claude และ NotebookLM เป็น PDF 100 หน้าเหมือนกัน – นี่คือใครที่คิดออก

ฉันค้นหาเอกสารความยาว 113 หน้าเกี่ยวกับการชนกันของรางรถไฟในอังกฤษ ครอบคลุมทุกอย่างตั้งแต่เหตุการณ์ที่นำไปสู่อุบัติเหตุ ไปจนถึงปัจจัยด้านเทคนิคและองค์กรที่อยู่เบื้องหลัง เอกสารยังมีภาพและกราฟจำนวนมาก และยังมีโอกาสที่ดีที่จะทดสอบว่าเครื่องมือสามารถเชื่อมโยงข้อมูลที่กระจัดกระจายในส่วนต่างๆ ของรายงานได้หรือไม่

ดังนั้นฉันจึงมอบเอกสารให้กับเครื่องมือทั้งสาม เพื่อให้การทดสอบมีความยุติธรรมที่สุดเท่าที่จะเป็นไปได้ ฉันจึงใช้เวอร์ชันที่ดีที่สุดของทั้งสามเวอร์ชัน นี่คือคำถามที่ฉันใช้:

  • เหตุปะทะกันเกิดขึ้นเมื่อใด และรถไฟทั้งสองขบวนเดินทางด้วยความเร็วเท่าใด

  • สำหรับคนที่ไม่มีพื้นฐานเรื่องรถไฟ ให้อธิบายสิ่งที่เกิดขึ้นในห้าประโยค

  • ย้อนรอยเหตุการณ์ที่นำไปสู่การชนกันตามลำดับเวลา

  • สาเหตุโดยตรงของอุบัติเหตุคืออะไร และปัจจัยใดที่ทำให้เกิดอุบัติเหตุได้

  • หลักฐานใดที่สนับสนุนข้อสรุปของรายงานว่าเหตุใดรถไฟจึงไม่สามารถหยุดได้

  • ใครเป็นผู้จัดการการออกแบบการติดตั้ง TPWS

  • จากรายงานเพียงอย่างเดียว การแทรกแซงใดที่จะป้องกันการชนได้โดยตรง อธิบายโดยใช้หลักฐาน

  • ดู รูปภาพ 41 ณ วันที่เกิดอุบัติเหตุ โต๊ะทำงานของ Ellipse อยู่ที่ด้านบนหรือด้านล่างเส้นมัธยฐานสีแดง และทั้งสองตำแหน่งแยกจากกันประมาณกี่ตำแหน่ง

คำถามทั้งหมดนี้ออกแบบมาเพื่อทดสอบความเข้าใจในเอกสารที่แตกต่างกันเล็กน้อย บางคำถามเป็นคำถามค้นหาที่ตรงไปตรงมา ในขณะที่บางคำถามต้องใช้เครื่องมือในการสรุป สร้างตารางใหม่ เชื่อมโยงหลักฐานจากส่วนต่างๆ หลักฐานจากการค้นพบในรายงาน หรือตีความแผนภาพอย่างถูกต้อง

ChatGPT เป็นผู้ชนะอย่างน่าประหลาดใจ

เมื่อมันเป็นเรื่องสำคัญ ChatGPT ก็ก้าวขึ้นมา

ฉันใช้เวลามากมายในการพูดคุยกันว่า ChatGPT ล้าหลังคู่แข่งในช่วง 2-3 เดือนที่ผ่านมาอย่างไร แต่เมื่อไม่นานมานี้ ฉันได้รับการพิสูจน์แล้วว่าคิดผิด ประสบการณ์นี้เป็นอีกตัวอย่างหนึ่งของการไม่เป็นเช่นนั้น

สำหรับผู้เริ่มต้นจากเครื่องมือทั้งสามนี้ ChatGPT เป็นเพียงเครื่องมือเดียวที่ให้เวลาที่แน่นอนของการชนกัน: 18:42:57 แทนที่จะปัดเศษเป็น 18:43 แม้จะเป็นรายละเอียดเล็กๆ น้อยๆ แต่เป็นสัญญาณเริ่มต้นที่ ChatGPT กำลังเจาะลึกเข้าไปในรายงานเล็กน้อย แทนที่จะหยุดที่คำตอบที่แม่นยำที่สุดในระดับสรุป

ความได้เปรียบของมันก็ชัดเจนมากขึ้นเมื่อคำถามเริ่มยากขึ้น ChatGPT เป็นหนึ่งในวิธีที่ละเอียดที่สุดเมื่อฉันขอให้กู้คืนเหตุการณ์ก่อนเกิดการชนกัน

จะดียิ่งขึ้นไปอีกเมื่อฉันเลิกค้นหาแบบง่ายๆ และเริ่มถามคำถามที่ต้องมีการสังเคราะห์อย่างแท้จริง ตัวอย่างเช่น เมื่อฉันถามหลักฐานที่สนับสนุนข้อสรุปของรายงานว่าเหตุใดรถไฟจึงไม่จอด ChatGPT จึงรวบรวมข้อมูลจากเครื่องบันทึกของรถไฟ การดำเนินการป้องกันสไลด์ การตรวจสอบทางกายภาพของรางที่ปนเปื้อน การทดสอบหลังเกิดอุบัติเหตุ และผลการสอบสวนเกี่ยวกับจุดที่คนขับใช้เบรก

แทนที่จะถือว่าคำตอบเพียงย่อหน้าเดียว กลับเชื่อมโยงข้อเท็จจริงที่กระจัดกระจายในรายงานเพื่ออธิบายว่าทำไมผู้สืบสวนถึงข้อสรุป

ความผิดพลาดครั้งใหญ่ที่สุดของ Claude ฟังดูน่าเชื่อถืออย่างยิ่ง

นี่คือจุดที่คลอดด์สูญเสียฉัน

Chat Claude อธิบายว่าเหตุใดการติดตั้งระบบขัดแบบแปรผันคู่จึงเป็นการแทรกแซงที่สำคัญที่สุดสำหรับการชนที่ซอลส์บรี

ฉันตั้งใจรวมข้อความค้นหาจากหน้า 80 ของ PDF เพื่อดูว่าเครื่องมือค้นหาเอกสารทั้งหมดจริงหรือไม่ แทนที่จะอาศัยข้อมูลสรุปและส่วนที่ใกล้กับจุดเริ่มต้นมากขึ้น เครื่องมือทั้งสามสามารถตอบสนองได้สำเร็จ แต่ความแตกต่างที่ใหญ่ที่สุดเกิดขึ้นเมื่อฉันถามว่าการแทรกแซงใดที่ป้องกันการชนกันโดยตรง

Claude เปรียบเทียบว่าเหตุใดการแทรกแซงทางเลือกจึงมีประสิทธิภาพน้อยกว่าการพ่นทรายด้วย DVRS เพื่อป้องกันการชนกันของซอลส์บรี

คำถามนี้ต้องการมากกว่าการค้นหาย่อหน้าที่เหมาะสมแล้วทวนซ้ำ รายงานจำลองสถานการณ์การเบรกที่แตกต่างกันจริงๆ และ ChatGPT ก็นำเสนอหนึ่งในสถานการณ์ที่มีประโยชน์มากที่สุด: RAIB พบว่า เมื่อพิจารณาเงื่อนไขในคืนนั้น การชนสามารถหลีกเลี่ยงได้หากคนขับเริ่มเบรกที่สะพานหัก นอกจากนี้ยังแตกต่างจากการเบรกบนต้นไม้ที่ล้มในเวลาต่อมาเล็กน้อย โดยที่รายงานไม่มั่นใจว่าจะสามารถหลีกเลี่ยงการชนได้ ความแตกต่างเล็กๆ น้อยๆ นี้เป็นสิ่งที่ฉันหวังว่าคำถามเหล่านี้จะเปิดเผยออกมา

น่าสนใจที่โคลดทำผิดเรื่องนี้โดยตรง โดยระบุว่าระบบเบรกแบบปรับความเร็วได้คู่ (DVRS) เป็นการแทรกแซงโดยตรง และยังอ้างว่ารายงานไม่ได้ระบุจำนวนว่าจะเกิดอะไรขึ้นหากผู้ขับขี่เบรกเร็วกว่าที่สะพานหัก ยกเว้น: RAIB จำลองสถานการณ์นี้อย่างชัดเจนและสรุปว่าหากมีการใช้เบรกที่นั่น การชนก็น่าจะสามารถหลีกเลี่ยงได้

นี่กลายเป็นหนึ่งในความแตกต่างที่ชัดเจนระหว่างเครื่องมือสำหรับฉัน คำตอบของ Claude ฟังดูน่าเชื่อและได้รับการสนับสนุนจากข้อเท็จจริงที่เกี่ยวข้อง แต่พลาดข้อเท็จจริงโดยตรงในที่อื่นในรายงาน!

อีกแง่มุมหนึ่งของคำตอบของโคลด์ที่ทำให้ฉันผิดหวังก็คือคำตอบบางข้อนั้นซับซ้อนเพียงใด ตัวอย่างเช่น แม้ว่าฉันจะขอให้เขาอธิบายอุบัติเหตุให้คนที่ไม่มีพื้นฐานการรถไฟอธิบายในห้าประโยคอย่างชัดเจน แต่กลับเป็นศัพท์ทางเทคนิคที่มากเกินความจำเป็น

คลอดด์อธิบายเรื่องรถไฟชนกันที่ซอลส์บรีในห้าประโยคสำหรับคนที่ไม่มีพื้นฐานเรื่องรถไฟ

สิ่งที่ทำให้ฉันผิดหวังที่นี่คือคำตอบนั้นไม่ได้เรียบง่ายจริงๆ แต่เกือบจะเป็นบทกวีและขัดเกลาจนเกินไป ฟังดูดี แต่ไม่ใช่สิ่งที่ฉันกำลังมองหา ฉันต้องการคำอธิบายที่คุณสามารถให้คนที่ไม่มีความรู้เกี่ยวกับการรถไฟเพื่อหยุดพวกเขาจากการถอดรหัสคำศัพท์เพียงครึ่งเดียว

ระบบการอ้างอิงของ NotebookLM ยังคงยุ่งยาก

เครดิตที่ถึงกำหนดชำระเครดิต

ChatGPT อาจชนะใจฉันในแง่ของความลึกและคุณภาพของคำตอบ แต่ NotebookLM ยังคงมีความได้เปรียบในเรื่องลิงก์ คำตอบทั้งหมดที่คุณได้รับจะถูกรวบรวมด้วยเครื่องหมายคำพูดที่คลิกได้ และเลื่อนเมาส์ไปเหนือคำตอบเหล่านั้นเพื่อแสดงส่วนของคำตอบที่แน่นอนโดยไม่ต้องบังคับให้คุณค้นหาในเอกสาร

แม้ว่าในทางเทคนิคแล้วคุณสามารถขอให้ ChatGPT ชี้ให้คุณทราบว่าข้อมูลมาจากไหน แต่คำพูดของ NotebookLM ก็ทำให้ฉันแตกสลาย! ควรสังเกตว่า NotebookLM ไม่ทำให้ฉันผิดหวังกับคุณภาพของคำตอบ ต่างจากโคลด์ตรงที่ไม่มีคำตอบใดที่ไม่ถูกต้องหรือใช้ถ้อยคำมากเกินไป

อย่างไรก็ตาม เมื่อเปรียบเทียบกับ ChatGPT พวกเขามักจะรู้สึกว่าตนมีระดับมากกว่า โดยปกติแล้วจะพบข้อมูลที่ถูกต้องและอธิบายอย่างชัดเจน แต่ ChatGPT สามารถดึงรายละเอียดจากส่วนต่างๆ ของรายงานมารวมกันได้ดีกว่า และเพิ่มรายละเอียดเล็กน้อยที่ทำให้คำตอบดูสมบูรณ์ยิ่งขึ้น

ในที่สุดผลลัพธ์ของการทดลองนี้ก็น่าสนใจมากกว่าที่ฉันคาดไว้! แม้ว่าฉันยังคงต้องการพึ่งพา NotebookLM ในสถานการณ์ที่ฉันไม่ต้องการให้เกิดอาการประสาทหลอน แต่ฉันคิดว่า ChatGPT ทำให้เกิดการแข่งขันที่รุนแรงเมื่อพูดถึงการวิเคราะห์ PDF



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *

Delta Air Lines (m1h262p) Delta Air Lines (m1h26g2) 애벗잡담잡이 애벗태양새 애벗얼가니새 애벗찌르레기 압드알쿠리참새 압딤황새 아버데어시스티콜라 이상한덤불개개비 에이버트북미덤불멧새 아비시니아캣버드 아비시니아크림슨윙 아비시니아지상코뿔새 아비시니아지상지빠귀 아비시니아긴발톱할미새 아비시니아올빼미 아비시니아파랑새 아비시니아낫부리후투티 아비시니아슬레이티딱새 아비시니아지빠귀 아비시니아왁스빌 아비시니아검은딱새 아비시니아동박새 아비시니아딱따구리 아카시아얼룩바벳 아카시아박새 아카디아딱새 아체직박구리 도토리딱따구리 아크레앤트슈라이크 아크레토디타이런트 아다마와멧비둘기 애들레이드솔새 아델리펭귄 애드미럴티매미새 아페프비둘기 아프간잡담잡이 아프간눈참새 아프리카줄무늬올빼미 아프리카검은오리 아프리카검은칼새 아프리카푸른딱새 아프리카푸른박새 아프리카넓적부리새 아프리카시트릴 아프리카목걸이멧비둘기 아프리카뜸부기 아프리카크림슨윙핀치 아프리카뻐꾸기 아프리카뻐꾸기매 아프리카뱀목가마우지 아프리카사막솔새 아프리카어두운색딱새 아프리카난쟁이물총새 아프리카에메랄드뻐꾸기 아프리카발가락물닭 아프리카파이어핀치 아프리카물수리 아프리카꾀꼬리 아프리카참매 아프리카풀올빼미 아프리카녹색비둘기 아프리카회색딱새 아프리카회색코뿔새 아프리카회색딱따구리 아프리카하리어매 아프리카매수리 아프리카산악잡담잡이 아프리카황조롱이 아프리카후투티 아프리카물꿩 아프리카습지하리어 아프리카올리브비둘기 아프리카대머리황새 아프리카검은머리물떼새 아프리카종려칼새 아프리카긴꼬리딱새 아프리카펭귄 아프리카피쿨렛 아프리카얼룩코뿔새 아프리카얼룩할미새 아프리카밭종다리 아프리카팔색조 아프리카난쟁이거위 아프리카난쟁이물총새 아프리카뜸부기 아프리카붉은눈직박구리 아프리카갈대개개비 아프리카강제비 아프리카바위 종다리류 아프리카성따오기 아프리카소쩍새 아프리카때까치딱새 아프리카은부리참새 아프리카제비물떼새 아프리카도요 아프리카저어새 아프리카점박이나무타기 아프리카검은딱새 아프리카뜸부기 아프리카지빠귀 아프리카볏도요 아프리카숲올빼미 아프리카노랑솔새 아가미왜가리 날렵한박새딱딱새