ฉันให้ ChatGPT, Claude และ NotebookLM เป็น PDF 100 หน้าเหมือนกัน – นี่คือใครที่คิดออก
ฉันได้ลองใช้เครื่องมือ AI มานับไม่ถ้วนและพบว่ามีการบรรยายสรุปนับล้านครั้ง ณ จุดนี้ และสิ่งที่ฉันกลับมาคือกรณีการใช้งาน AI เพียงไม่กี่กรณีที่ออกแบบมาสำหรับคนทั่วไป เราได้รับการแสดงตัวแทนอย่างต่อเนื่องที่สามารถบูรณาการขั้นตอนการทำงานที่สมบูรณ์ โมเดลที่สามารถเขียนฐานโค้ดทั้งหมด และคุณสมบัติเฉพาะที่เพิ่มขึ้นซึ่งฟังดูน่าประทับใจเมื่อแสดง แต่ไม่จำเป็นว่าเป็นสิ่งที่คนส่วนใหญ่ต้องการ
กรณีการใช้งานอย่างหนึ่งที่ฉันไม่เคยรู้สึกอยากทำมาก่อนก็คือการจัดทำเอกสาร มอบ PDF ที่ยาวจนน่าขันให้กับ AI ถามคำถามสองสามข้อ แล้วมันจะตอบสนองสิ่งที่คุณต้องการ นี่คือสิ่งที่ฉันสามารถจินตนาการได้ว่าใครๆ ก็พบว่ามีประโยชน์ NotebookLM เป็นเครื่องมือที่ฉันชื่นชอบในกรณีนี้ แต่ ChatGPT และ Claude ก็ทำงานได้ดีกว่ามากในการทำงานกับเอกสารขนาดยาว
ดังนั้นฉันจึงตัดสินใจให้พวกเขาทดสอบโดยให้ ChatGPT, Claude และ NotebookLM มีเอกสารมากกว่า 100 หน้าเหมือนกัน
ฉันลองทั้งสามรายการด้วยเอกสารและคำถามเดียวกัน
PDF เดียวกัน คำถามเดียวกัน ไม่มีข้อแก้ตัว
ฉันค้นหาเอกสารความยาว 113 หน้าเกี่ยวกับการชนกันของรางรถไฟในอังกฤษ ครอบคลุมทุกอย่างตั้งแต่เหตุการณ์ที่นำไปสู่อุบัติเหตุ ไปจนถึงปัจจัยด้านเทคนิคและองค์กรที่อยู่เบื้องหลัง เอกสารยังมีภาพและกราฟจำนวนมาก และยังมีโอกาสที่ดีที่จะทดสอบว่าเครื่องมือสามารถเชื่อมโยงข้อมูลที่กระจัดกระจายในส่วนต่างๆ ของรายงานได้หรือไม่
ดังนั้นฉันจึงมอบเอกสารให้กับเครื่องมือทั้งสาม เพื่อให้การทดสอบมีความยุติธรรมที่สุดเท่าที่จะเป็นไปได้ ฉันจึงใช้เวอร์ชันที่ดีที่สุดของทั้งสามเวอร์ชัน นี่คือคำถามที่ฉันใช้:
-
เหตุปะทะกันเกิดขึ้นเมื่อใด และรถไฟทั้งสองขบวนเดินทางด้วยความเร็วเท่าใด
-
สำหรับคนที่ไม่มีพื้นฐานเรื่องรถไฟ ให้อธิบายสิ่งที่เกิดขึ้นในห้าประโยค
-
ย้อนรอยเหตุการณ์ที่นำไปสู่การชนกันตามลำดับเวลา
-
สาเหตุโดยตรงของอุบัติเหตุคืออะไร และปัจจัยใดที่ทำให้เกิดอุบัติเหตุได้
-
หลักฐานใดที่สนับสนุนข้อสรุปของรายงานว่าเหตุใดรถไฟจึงไม่สามารถหยุดได้
-
ใครเป็นผู้จัดการการออกแบบการติดตั้ง TPWS
-
จากรายงานเพียงอย่างเดียว การแทรกแซงใดที่จะป้องกันการชนได้โดยตรง อธิบายโดยใช้หลักฐาน
-
ดู รูปภาพ 41 ณ วันที่เกิดอุบัติเหตุ โต๊ะทำงานของ Ellipse อยู่ที่ด้านบนหรือด้านล่างเส้นมัธยฐานสีแดง และทั้งสองตำแหน่งแยกจากกันประมาณกี่ตำแหน่ง
คำถามทั้งหมดนี้ออกแบบมาเพื่อทดสอบความเข้าใจในเอกสารที่แตกต่างกันเล็กน้อย บางคำถามเป็นคำถามค้นหาที่ตรงไปตรงมา ในขณะที่บางคำถามต้องใช้เครื่องมือในการสรุป สร้างตารางใหม่ เชื่อมโยงหลักฐานจากส่วนต่างๆ หลักฐานจากการค้นพบในรายงาน หรือตีความแผนภาพอย่างถูกต้อง
ChatGPT เป็นผู้ชนะอย่างน่าประหลาดใจ
เมื่อมันเป็นเรื่องสำคัญ ChatGPT ก็ก้าวขึ้นมา
ฉันใช้เวลามากมายในการพูดคุยกันว่า ChatGPT ล้าหลังคู่แข่งในช่วง 2-3 เดือนที่ผ่านมาอย่างไร แต่เมื่อไม่นานมานี้ ฉันได้รับการพิสูจน์แล้วว่าคิดผิด ประสบการณ์นี้เป็นอีกตัวอย่างหนึ่งของการไม่เป็นเช่นนั้น
สำหรับผู้เริ่มต้นจากเครื่องมือทั้งสามนี้ ChatGPT เป็นเพียงเครื่องมือเดียวที่ให้เวลาที่แน่นอนของการชนกัน: 18:42:57 แทนที่จะปัดเศษเป็น 18:43 แม้จะเป็นรายละเอียดเล็กๆ น้อยๆ แต่เป็นสัญญาณเริ่มต้นที่ ChatGPT กำลังเจาะลึกเข้าไปในรายงานเล็กน้อย แทนที่จะหยุดที่คำตอบที่แม่นยำที่สุดในระดับสรุป
ความได้เปรียบของมันก็ชัดเจนมากขึ้นเมื่อคำถามเริ่มยากขึ้น ChatGPT เป็นหนึ่งในวิธีที่ละเอียดที่สุดเมื่อฉันขอให้กู้คืนเหตุการณ์ก่อนเกิดการชนกัน
จะดียิ่งขึ้นไปอีกเมื่อฉันเลิกค้นหาแบบง่ายๆ และเริ่มถามคำถามที่ต้องมีการสังเคราะห์อย่างแท้จริง ตัวอย่างเช่น เมื่อฉันถามหลักฐานที่สนับสนุนข้อสรุปของรายงานว่าเหตุใดรถไฟจึงไม่จอด ChatGPT จึงรวบรวมข้อมูลจากเครื่องบันทึกของรถไฟ การดำเนินการป้องกันสไลด์ การตรวจสอบทางกายภาพของรางที่ปนเปื้อน การทดสอบหลังเกิดอุบัติเหตุ และผลการสอบสวนเกี่ยวกับจุดที่คนขับใช้เบรก
แทนที่จะถือว่าคำตอบเพียงย่อหน้าเดียว กลับเชื่อมโยงข้อเท็จจริงที่กระจัดกระจายในรายงานเพื่ออธิบายว่าทำไมผู้สืบสวนถึงข้อสรุป
ความผิดพลาดครั้งใหญ่ที่สุดของ Claude ฟังดูน่าเชื่อถืออย่างยิ่ง
นี่คือจุดที่คลอดด์สูญเสียฉัน
ฉันตั้งใจรวมข้อความค้นหาจากหน้า 80 ของ PDF เพื่อดูว่าเครื่องมือค้นหาเอกสารทั้งหมดจริงหรือไม่ แทนที่จะอาศัยข้อมูลสรุปและส่วนที่ใกล้กับจุดเริ่มต้นมากขึ้น เครื่องมือทั้งสามสามารถตอบสนองได้สำเร็จ แต่ความแตกต่างที่ใหญ่ที่สุดเกิดขึ้นเมื่อฉันถามว่าการแทรกแซงใดที่ป้องกันการชนกันโดยตรง
คำถามนี้ต้องการมากกว่าการค้นหาย่อหน้าที่เหมาะสมแล้วทวนซ้ำ รายงานจำลองสถานการณ์การเบรกที่แตกต่างกันจริงๆ และ ChatGPT ก็นำเสนอหนึ่งในสถานการณ์ที่มีประโยชน์มากที่สุด: RAIB พบว่า เมื่อพิจารณาเงื่อนไขในคืนนั้น การชนสามารถหลีกเลี่ยงได้หากคนขับเริ่มเบรกที่สะพานหัก นอกจากนี้ยังแตกต่างจากการเบรกบนต้นไม้ที่ล้มในเวลาต่อมาเล็กน้อย โดยที่รายงานไม่มั่นใจว่าจะสามารถหลีกเลี่ยงการชนได้ ความแตกต่างเล็กๆ น้อยๆ นี้เป็นสิ่งที่ฉันหวังว่าคำถามเหล่านี้จะเปิดเผยออกมา
น่าสนใจที่โคลดทำผิดเรื่องนี้โดยตรง โดยระบุว่าระบบเบรกแบบปรับความเร็วได้คู่ (DVRS) เป็นการแทรกแซงโดยตรง และยังอ้างว่ารายงานไม่ได้ระบุจำนวนว่าจะเกิดอะไรขึ้นหากผู้ขับขี่เบรกเร็วกว่าที่สะพานหัก ยกเว้น: RAIB จำลองสถานการณ์นี้อย่างชัดเจนและสรุปว่าหากมีการใช้เบรกที่นั่น การชนก็น่าจะสามารถหลีกเลี่ยงได้
นี่กลายเป็นหนึ่งในความแตกต่างที่ชัดเจนระหว่างเครื่องมือสำหรับฉัน คำตอบของ Claude ฟังดูน่าเชื่อและได้รับการสนับสนุนจากข้อเท็จจริงที่เกี่ยวข้อง แต่พลาดข้อเท็จจริงโดยตรงในที่อื่นในรายงาน!
อีกแง่มุมหนึ่งของคำตอบของโคลด์ที่ทำให้ฉันผิดหวังก็คือคำตอบบางข้อนั้นซับซ้อนเพียงใด ตัวอย่างเช่น แม้ว่าฉันจะขอให้เขาอธิบายอุบัติเหตุให้คนที่ไม่มีพื้นฐานการรถไฟอธิบายในห้าประโยคอย่างชัดเจน แต่กลับเป็นศัพท์ทางเทคนิคที่มากเกินความจำเป็น
สิ่งที่ทำให้ฉันผิดหวังที่นี่คือคำตอบนั้นไม่ได้เรียบง่ายจริงๆ แต่เกือบจะเป็นบทกวีและขัดเกลาจนเกินไป ฟังดูดี แต่ไม่ใช่สิ่งที่ฉันกำลังมองหา ฉันต้องการคำอธิบายที่คุณสามารถให้คนที่ไม่มีความรู้เกี่ยวกับการรถไฟเพื่อหยุดพวกเขาจากการถอดรหัสคำศัพท์เพียงครึ่งเดียว
ระบบการอ้างอิงของ NotebookLM ยังคงยุ่งยาก
เครดิตที่ถึงกำหนดชำระเครดิต
ChatGPT อาจชนะใจฉันในแง่ของความลึกและคุณภาพของคำตอบ แต่ NotebookLM ยังคงมีความได้เปรียบในเรื่องลิงก์ คำตอบทั้งหมดที่คุณได้รับจะถูกรวบรวมด้วยเครื่องหมายคำพูดที่คลิกได้ และเลื่อนเมาส์ไปเหนือคำตอบเหล่านั้นเพื่อแสดงส่วนของคำตอบที่แน่นอนโดยไม่ต้องบังคับให้คุณค้นหาในเอกสาร
แม้ว่าในทางเทคนิคแล้วคุณสามารถขอให้ ChatGPT ชี้ให้คุณทราบว่าข้อมูลมาจากไหน แต่คำพูดของ NotebookLM ก็ทำให้ฉันแตกสลาย! ควรสังเกตว่า NotebookLM ไม่ทำให้ฉันผิดหวังกับคุณภาพของคำตอบ ต่างจากโคลด์ตรงที่ไม่มีคำตอบใดที่ไม่ถูกต้องหรือใช้ถ้อยคำมากเกินไป
อย่างไรก็ตาม เมื่อเปรียบเทียบกับ ChatGPT พวกเขามักจะรู้สึกว่าตนมีระดับมากกว่า โดยปกติแล้วจะพบข้อมูลที่ถูกต้องและอธิบายอย่างชัดเจน แต่ ChatGPT สามารถดึงรายละเอียดจากส่วนต่างๆ ของรายงานมารวมกันได้ดีกว่า และเพิ่มรายละเอียดเล็กน้อยที่ทำให้คำตอบดูสมบูรณ์ยิ่งขึ้น
ในที่สุดผลลัพธ์ของการทดลองนี้ก็น่าสนใจมากกว่าที่ฉันคาดไว้! แม้ว่าฉันยังคงต้องการพึ่งพา NotebookLM ในสถานการณ์ที่ฉันไม่ต้องการให้เกิดอาการประสาทหลอน แต่ฉันคิดว่า ChatGPT ทำให้เกิดการแข่งขันที่รุนแรงเมื่อพูดถึงการวิเคราะห์ PDF