TH ▾

เริ่มต้นด้วยเครดิตทดลองใช้

อีเมลและรหัสผ่าน คีย์แสดงบนหน้าจอทันที

https://api.uncensoredllmhub.com/v1

โมเดล Ollama ไม่เซ็นเซอร์: ในเครื่อง vs คลาวด์

โมเดล Ollama แบบไม่เซ็นเซอร์ให้การควบคุมเต็มที่เหนือค่าน้ำหนักโมเดลและข้อจำกัดเนื้อหา แต่ต้องการฮาร์ดแวร์และการดูแลรักษาที่สูง การเปลี่ยนไปใช้ API ที่โฮสต์ไว้สำหรับการอนุมานแบบไม่เซ็นเซอร์ช่วยกำจัดการจัดการ GPU ในขณะที่รักษาความสามารถในการสร้างเนื้อหาที่ไม่ถูกจำกัดผ่านโปรโตคอลมาตรฐาน

อัปเดต

จุดสำคัญ

  • การประมวลผลในเครื่องเสนออธิปไตยของข้อมูลสมบูรณ์และต้นทุนต่อโทเคนเป็นศูนย์แต่ต้องการการลงทุนฮาร์ดแวร์เริ่มต้นจำนวนมากและการบำรุงรักษาอย่างต่อเนื่อง
  • API แบบโฮสต์เสนอความสามารถในการปรับขนาดได้ทันทีและราคาต่อโทเคนที่คาดการณ์ได้ กำจัดความต้องการในการจัดการไดรเวอร์ GPU และการระบายความร้อน
  • Ollama ทำให้การจัดการโมเดลในเครื่องง่ายขึ้นแต่ไม่เปลี่ยนข้อจำกัดทางกายภาพของการรันโมเดลขนาดใหญ่บนฮาร์ดแวร์ของคุณเอง
  • API ที่โฮสต์ไว้ใช้โมเดลแบบไม่เซ็นเซอร์ที่สร้างขึ้นมาโดยเฉพาะ มีหน้าต่างบริบทขนาด 100,000 โทเคน และเข้าถึงได้ผ่านเอนด์พอยต์ที่เข้ากันได้กับมาตรฐาน OpenAI

โมเดล Ollama ไม่เซ็นเซอร์คืออะไร?

Ollama คือเครื่องมือที่ช่วยให้การปรับใช้โมเดลภาษาขนาดใหญ่ (LLM) บนฮาร์ดแวร์ในเครื่องทำได้ง่ายขึ้น โดยจะรวมโมเดลพร้อมกับส่วนประกอบที่จำเป็น ทำให้นักพัฒนาสามารถรันโมเดลได้โดยตรงจากบรรทัดคำสั่ง เมื่อผู้คนพูดถึง "โมเดล Ollama แบบไม่เซ็นเซอร์" พวกเขามักจะหมายถึงโมเดลแบบเปิดน้ำหนักที่ถูกดัดแปลงหรือเลือกมาเพื่อลบตัวกรองความปลอดภัยที่พบในโมเดลเชิงพาณิชย์เช่น GPT-4 หรือ Claude

โมเดลเหล่านี้ไม่ปฏิเสธหัวข้อโดยธรรมชาติเพียงเพราะความสุภาพหรือแนวทางของแบรนด์ แต่จะสร้างข้อความตามข้อมูลการฝึกและการปรับแต่งความสอดคล้อง (alignment tuning) ป้าย "ไม่เซ็นเซอร์" มักหมายถึงการลบข้อจำกัดจากการเรียนรู้แบบเสริมจากมนุษย์ (RLHF) ซึ่งเป็นสาเหตุที่ทำให้โมเดลปฏิเสธคำขอบางประเภทที่เกี่ยวข้องกับผู้ใหญ่ การเมือง หรือข้อขัดแย้ง

แม้ว่า Ollama จะเป็นตัวรันโมเดลที่ได้รับความนิยมสำหรับโมเดลเหล่านี้ แต่ก็เป็นเพียงอินเทอร์เฟซเท่านั้น ไฟล์โมเดลพื้นฐาน (ซึ่งมักอยู่ในรูปแบบ GGUF) คือสิ่งที่กำหนดพฤติกรรมที่แท้จริง คุณสามารถดาวน์โหลดรูปแบบที่ไม่เซ็นเซอร์ได้หลายแบบ แต่คุณต้องรับผิดชอบในการตรวจสอบคุณสมบัติการปรับแต่งความสอดคล้องเฉพาะของโมเดลเหล่านั้น วิธีการในเครื่องนี้ทำให้คุณเห็นได้อย่างชัดเจนว่าโมเดลรู้จักข้อมูลใดและตอบสนองอย่างไร โดยไม่มีบริการบุคคลที่สามกรองข้อมูลขาเข้าหรือขาออกของคุณ

ต้นทุนของการประมวลผลในเครื่อง

การรันโมเดลแบบไม่เซ็นเซอร์ในเครื่องต้องการฮาร์ดการ์ดจอ (GPU) เฉพาะทาง การ์ดจอระดับสูงสำหรับผู้ใช้ทั่วไปเช่น NVIDIA RTX 4090 ให้ประสิทธิภาพที่แข็งแกร่งสำหรับโมเดลขนาด 7B ถึง 13B พารามิเตอร์ อย่างไรก็ตาม เพื่อรันโมเดลขนาดใหญ่ได้อย่างมีประสิทธิภาพ คุณอาจต้องการ GPU หลายตัวหรือการ์ดระดับองค์กรเช่น A100 หรือ H100 ซึ่งอาจมีราคาหลายหมื่นดอลลาร์

นอกเหนือจากฮาร์ดแวร์แล้วยังมีต้นทุนการดำเนินงาน คุณต้องจัดการการใช้พลังงาน การระบายความร้อน และการเสื่อมสภาพของฮาร์ดแวร์ หาก GPU ล้มเหลว บริการอนุมานของคุณจะหยุดทำงานจนกว่าคุณจะแทนที่มัน นอกจากนี้ คุณต้องจัดการการอัปเดตซอฟต์แวร์ ความเข้ากันได้ของไดรเวอร์ และการบำรุงรักษา OS

สำหรับทีมขนาดเล็กหรือนักพัฒนาอิสระ ต้นทุนคงที่เหล่านี้อาจสูงเกินไป การ์ดจอระดับสูงหนึ่งใบอาจมีราคาเท่ากับค่าใช้จ่ายในการใช้งาน API เป็นเวลาหลายปีสำหรับการรับส่งข้อมูลระดับปานกลาง การอนุมานในเครื่องจะมีประสิทธิภาพด้านต้นทุนก็ต่อเมื่อคุณมีปริมาณงานสูงและต่อเนื่องที่ justifices การใช้จ่ายด้านทุน สำหรับงานที่มีลักษณะเป็นช่วงๆ หรือปริมาณต่ำ ค่าใช้จ่ายต่อโทเคนของ API ที่โฮสต์ไว้มักจะถูกกว่าต้นทุนที่กระจายตามเวลาของฮาร์ดแวร์ของคุณ

ความสามารถในการปรับขนาดและความน่าเชื่อถือ

การอนุมานในเครื่องขยายขนาดได้ในแนวตั้ง เพื่อจัดการคำขอมากขึ้น คุณต้องการฮาร์ดแวร์ทางกายภาพมากขึ้น การขยายขนาดในแนวนอนต้องการการกระจายโหลดข้ามเครื่องหลายเครื่อง ซึ่งเพิ่มความซับซ้อนให้กับโครงสร้างพื้นฐานของคุณ คุณต้องรับผิดชอบในการรับประกันเวลาทำงาน การจัดการกับปริมาณการรับส่งข้อมูลที่พุ่งสูงขึ้น และการอัปเดตโมเดล

ในทางตรงกันข้าม API ที่โฮสต์ไว้จะจัดการการขยายขนาดโดยอัตโนมัติ ผู้ให้บริการจัดการกลุ่ม GPU การกระจายโหลด และกลไกการล้มเหลว เมื่อคุณส่งคำขอ คุณไม่จำเป็นต้องกังวลว่าเซิร์ฟเวอร์จะยุ่งอยู่หรือไม่ หรือฮาร์ดแวร์ต้องการการบำรุงรักษาหรือไม่ เอนด์พอยต์ของ API จะคงความเสถียรไม่ว่าจะมีการเปลี่ยนแปลงภายในอย่างไร

ความน่าเชื่อถือยังเป็นตัวแยกความแตกต่างที่สำคัญ การตั้งค่าในเครื่องขึ้นอยู่กับสภาวะเครือข่ายท้องถิ่น ไฟดับ และความล้มเหลวของฮาร์ดแวร์ บริการแบบโฮสต์มักเสนอการรับประกันเวลาทำงานที่สูงกว่าแม้ว่า SLA เฉพาะจะแตกต่างกัน สำหรับแอปพลิเคชันการผลิตที่ความสม่ำเสมอสำคัญ ลักษณะการจัดการของ API แบบโฮสต์ลดความเสี่ยงในการดำเนินงาน คุณได้ความหน่วงและการไหลผ่านที่คาดการณ์ได้โดยไม่ต้องจัดการทรัพยากรการคำนวณพื้นฐาน

การเปรียบเทียบความเร็วในการพัฒนา

การพัฒนาในเครื่องอนุญาตให้ทำซ้ำอย่างรวดเร็วบนวิศวกรรมพรอมต์และพารามิเตอร์โมเดล คุณสามารถปรับแต่งการตั้งค่าเช่นอุณหภูมิและ top-p ได้ทันทีโดยไม่มีความหน่วงของเครือข่าย อย่างไรก็ตาม การตั้งค่าสภาพแวดล้อมตั้งแต่ต้นอาจใช้เวลา คุณต้องติดตั้ง CUDA ดาวน์โหลดโมเดล และกำหนดค่ารันไทม์

ด้วย API แบบโฮสต์ คุณสามารถเริ่มการผสานรวมได้ในไม่กี่นาที คุณต้องการเพียงคีย์ API และ URL พื้นฐาน ความเร็วนี้สำคัญสำหรับการสร้างต้นแบบและทดสอบโมเดลไม่เซ็นเซอร์ต่างๆ โดยไม่ต้องผูกมัดกับฮาร์ดแวร์ คุณสามารถเปลี่ยนโมเดลหรืออัปเดตแบ็กเอนด์โดยไม่เปลี่ยนโค้ดไคลเอนต์ของคุณ

curl https://api.uncensoredllmhub.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

แนวทางแบบโฮสต์ยังทำให้การผสานรวมกับระบบที่มีอยู่ง่ายขึ้น เนื่องจาก API เข้ากันได้กับ OpenAI คุณสามารถใช้ SDK และไลบรารีไคลเอนต์ที่คุณคุ้นเคยอยู่แล้ว สิ่งนี้ลดเส้นโค้งการเรียนรู้สำหรับผู้พัฒนาที่คุ้นเคยกับ API LLM มาตรฐาน คุณสามารถมุ่งเน้นไปที่การสร้างตรรกะแอปพลิเคชันของคุณแทนที่จะจัดการโครงสร้างพื้นฐานการอนุมาน

เมทริกซ์การตัดสินใจ: ในเครื่อง vs API

ปัจจัยการประมวลผลในเครื่องAPI แบบโฮสต์
ต้นทุนฮาร์ดแวร์สูงล่วงหน้า (ซื้อ GPU)ต่ำ (จ่ายต่อโทเคน)
ความสามารถในการปรับขนาดด้วยตนเอง (เพิ่ม GPU เพิ่มเติม)อัตโนมัติ (ผู้ให้บริการจัดการ)
การบำรุงรักษาสูง (ไดรเวอร์ OS การระบายความร้อน)ต่ำ (ผู้ให้บริการจัดการ)
ความเป็นส่วนตัวสูงสุด (ข้อมูลอยู่ในเครื่อง)สูง (ไม่มีการฝึกบนพรอมต์)
การปรับแต่งควบคุมเต็มรูปแบบเหนือโมเดลและรันไทม์จำกัดด้วยพารามิเตอร์ API
เวลาทำงานขึ้นอยู่กับฮาร์ดแวร์ของคุณขึ้นอยู่กับผู้ให้บริการ

เมทริกซ์นี้เน้นการแลกเปลี่ยน การประมวลผลในเครื่องเสนอการควบคุมและความปลอดภัยสูงสุดแต่ต้องการความพยายามและทุนจำนวนมาก API แบบโฮสต์เสนอความสะดวกและความสามารถในการปรับขนาดด้วยโมเดลค่าใช้จ่ายดำเนินงานที่คาดการณ์ได้

เมื่อใดควรเลือกแบบในเครื่อง

เลือกการประมวลผลในเครื่องหากคุณต้องการความเป็นส่วนตัวของข้อมูลอย่างเข้มงวด เนื่องจากข้อมูลไม่ออกจากเครื่องของคุณเลย คุณจึงหลีกเลี่ยงการส่งพรอมต์ที่ละเอียดอ่อนไปยังเซิร์ฟเวอร์บุคคลที่สาม สิ่งนี้สำคัญสำหรับกรณีการใช้งานด้านสุขภาพ กฎหมาย หรือข้อมูลที่เป็นกรรมสิทธิ์ซึ่งการปฏิบัติตามข้อกำหนดต้องการการประมวลผลในสถานที่

แบบในเครื่องยังดีกว่าสำหรับงานที่มีการไหลผ่านสูงและต่อเนื่อง หากคุณกำลังประมวลผลโทเคนล้านๆ ต่อวัน ต้นทุนต่อโทเคนของ API อาจเกินต้นทุนฮาร์ดแวร์ของคุณ นอกจากนี้หากคุณต้องการการควบคุมพฤติกรรมของโมเดลอย่างละเอียดเช่นการควอนไทซ์แบบกำหนดเองหรือแฟล็กรันไทม์เฉพาะ แบบในเครื่องให้ความอิสระนั้น

ผู้พัฒนาที่สนุกกับการปรับแต่งฮาร์ดแวร์และการกำหนดค่าซอฟต์แวร์จะพบว่าการประมวลผลในเครื่องคุ้มค่ากว่า มันให้ความเข้าใจที่ลึกซึ้งยิ่งขึ้นว่า LLM ทำงานอย่างไรภายใต้ฝากระโปรง อย่างไรก็ตาม ให้เตรียมพร้อมสำหรับความรับผิดชอบอย่างต่อเนื่องในการบำรุงรักษาการตั้งค่าของคุณ ความล้มเหลวของฮาร์ดแวร์และการอัปเดตซอฟต์แวร์เป็นส่วนหนึ่งของประสบการณ์ในเครื่อง

เมื่อใดควรเลือก API แบบโฮสต์

API แบบโฮสต์เหมาะสำหรับสตาร์ทอัพและทีมขนาดเล็กที่ขาดทรัพยากร DevOps เฉพาะทาง คุณสามารถเริ่มสร้างผลิตภัณฑ์ได้ทันทีโดยไม่ต้องรอการจัดส่ง GPU โมเดลแบบจ่ายตามการใช้งานหมายความว่าคุณจ่ายเฉพาะสิ่งที่ใช้ ทำให้จัดการกระแสเงินสดได้ง่าย

from openai import OpenAI

client = OpenAI(base_url="https://api.uncensoredllmhub.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

ใช้ API แบบโฮสต์เมื่อคุณต้องการความน่าเชื่อถือและความสามารถในการขยายขนาด หากแอปพลิเคชันของคุณมีการเพิ่มขึ้นของปริมาณการใช้งานที่ไม่คาดเดาได้ API จะจัดการภาระงานนั้นโดยไม่ต้องคุณจัดเตรียมเซิร์ฟเวอร์เพิ่มเติม วิธีนี้มีประโยชน์เป็นพิเศษสำหรับแอปพลิเคชันที่ให้บริการผู้ใช้ซึ่งการหยุดทำงานมีค่าใช้จ่ายสูง

สำหรับกรณีการใช้งานแบบไม่เซ็นเซอร์ API แบบโฮสต์ให้ประสบการณ์ที่สม่ำเสมอ คุณไม่จำเป็นต้องดาวน์โหลดและจัดการไฟล์โมเดลหลายไฟล์ API จะให้บริการโมเดลแบบไม่เซ็นเซอร์ที่ผ่านการปรับแต่งมาอย่างดีสำหรับการสร้างเนื้อหาแบบไม่มีข้อจำกัด ซึ่งช่วยลดความซับซ้อนในการทดสอบโมเดลรุ่นต่างๆ และทำให้พฤติกรรมสม่ำเสมอทั่วทั้งแอปพลิเคชันของคุณ

แนวทางแบบผสมผสาน

คุณไม่จำเป็นต้องเลือกเพียงอย่างใดอย่างหนึ่งระหว่างการใช้งานแบบโลคัลและแบบโฮสต์ แนวทางแบบผสมผสานช่วยให้คุณใช้การอนุมานแบบโลคัลสำหรับข้อมูลที่มีความละเอียดอ่อน และใช้ API สำหรับปริมาณการใช้งานทั่วไป กลยุทธ์นี้ช่วยสร้างความสมดุลระหว่างความเป็นส่วนตัวและความสามารถในการขยายขนาด

ตัวอย่างเช่น คุณสามารถรันโมเดลโลคัลสำหรับการวิจัยภายในหรือการประมวลผลข้อมูลเบื้องต้นที่ความเป็นส่วนตัวเป็นปัจจัยสำคัญ ในขณะที่คุณสามารถใช้ API แบบโฮสต์สำหรับฟีเจอร์ที่ผู้ใช้เข้าถึงได้ซึ่งต้องการความพร้อมใช้งานสูงและเวลาแฝงต่ำ วิธีนี้ช่วยให้คุณลดต้นทุนขณะยังคงควบคุมการดำเนินการที่ละเอียดอ่อนที่สุดของคุณได้

ตัวเลือกแบบผสมผสานอีกอย่างหนึ่งคือการใช้ API สำหรับการสร้างต้นแบบ จากนั้นจึงเปลี่ยนไปใช้การอนุมานแบบโลคัลเมื่อผลิตภัณฑ์ของคุณได้รับความนิยมและปริมาณการใช้งานเพียงพอที่จะรองรับการลงทุนด้านฮาร์ดแวร์ วิธีนี้ช่วยให้คุณตรวจสอบความเหมาะสมของผลิตภัณฑ์กับตลาดได้โดยไม่ต้องใช้เงินทุนเริ่มต้นจำนวนมาก คุณสามารถเปลี่ยนผ่านได้อย่างราบรื่นเมื่อรูปแบบการใช้งานของคุณชัดเจนขึ้น

คำแนะนำสุดท้าย

สำหรับนักพัฒนาส่วนใหญ่ที่ผสานรวม LLM แบบไม่เซ็นเซอร์ลงในแอปพลิเคชันของตนเอง API แบบโฮสต์ให้ความสมดุลที่ดีที่สุดระหว่างความสะดวก ความสามารถในการขยายขนาด และต้นทุน มันขจัดความยุ่งยากในการจัดการฮาร์ดแวร์และทำให้คุณสามารถมุ่งเน้นไปที่ผลิตภัณฑ์ของคุณได้ อินเทอร์เฟซที่เข้ากันได้กับ OpenAI ทำให้การผสานรวมทำได้ง่าย และโมเดลราคาแบบคาดการณ์ได้ช่วยให้การวางแผนงบประมาณง่ายขึ้น

การอนุมานแบบโลคัลยังคงเป็นตัวเลือกที่ดีที่สุดสำหรับกรณีการใช้งานเฉพาะที่ต้องการความเป็นส่วนตัวสูงสุด อัตราการส่งผ่านข้อมูลสูงอย่างต่อเนื่อง หรือการควบคุมฮาร์ดแวร์อย่างลึกซึ้ง หากคุณมีทรัพยากรและจำเป็นต้องเก็บข้อมูลภายในองค์กร การใช้งานแบบโลคัลจะดีกว่า

ควรพิจารณาขนาดทีม ความเชี่ยวชาญทางเทคนิค และความละเอียดอ่อนของข้อมูลของคุณเมื่อตัดสินใจ สำหรับกรณีการใช้งานแบบไม่เซ็นเซอร์ส่วนใหญ่ การเริ่มต้นด้วย API แบบโฮสต์และปรับขนาดแบบโลคัลตามความจำเป็นเป็นแนวทางที่ปฏิบัติได้จริง วิธีนี้ช่วยลดความเสี่ยงขณะยังคงเข้าถึงโมเดลที่มีประสิทธิภาพและไม่มีข้อจำกัด

ถาม-ตอบ

ความแตกต่างระหว่างโมเดลแบบไม่เซ็นเซอร์และแบบไม่มีตัวกรองคืออะไร?

โมเดลแบบไม่เซ็นเซอร์ผ่านการปรับแต่งหรือเลือกมาเพื่อลบตัวกรองความปลอดภัยที่ทำให้เกิดการปฏิเสธเนื้อหาสำหรับผู้ใหญ่หรือหัวข้อที่ถกเถกัน โมเดลแบบไม่มีตัวกรองขาดตัวกรองเหล่านี้ไปโดยสิ้นเชิง ในทางปฏิบัติ คำศัพท์ทั้งสองมักหมายถึงโมเดลที่สามารถสร้างเนื้อหาที่โมเดลเชิงพาณิชย์อาจบล็อก ความแตกต่างหลักคือโมเดลแบบไม่เซ็นเซอร์อาจยังคงมีการจัดแนวอยู่ ในขณะที่โมเดลแบบไม่มีตัวกรองจะใกล้เคียงกับโมเดลฐานดิบมากกว่า

ฉันต้องการ GPU ที่ทรงพลังเพื่อรัน Ollama แบบโลคอลหรือไม่?

ใช่ ข้อกำหนดของ GPU ขึ้นอยู่กับขนาดของโมเดล โมเดลขนาดเล็ก (7B พารามิเตอร์) สามารถรันบน GPU สำหรับผู้บริโภคสมัยใหม่เช่น RTX 3060 หรือ 4060 โมเดลขนาดใหญ่ (70B+) มักต้องการ GPU ระดับสูงเช่น A100 หรือการ์ดผู้บริโภคหลายใบ Ollama จัดการการลดทอนซึ่งลดการใช้หน่วยความจำ แต่คุณยังต้องการ VRAM เพียงพอเพื่อโหลดโมเดล

API แบบโฮสต์เปรียบเทียบความเร็วกับ Ollama ได้อย่างไร?

API แบบโฮสต์มักให้เวลาตอบสนองที่เร็วกว่าสำหรับการใช้งานทั่วไปเนื่องจากทำงานบนฮาร์ดแวร์ที่ปรับแต่งแล้วและเครือข่ายที่มีความหน่วงต่ำ ความเร็วในการอนุมานแบบโลคอลขึ้นอยู่กับ GPU และการระบายความร้อนเฉพาะของคุณ สำหรับโมเดลขนาดใหญ่ การอนุมานแบบโลคอลอาจช้ากว่าเนื่องจากข้อจำกัดของฮาร์ดแวร์ ในขณะที่ API ขยายขนาดเพื่อจัดการคำขอได้อย่างมีประสิทธิภาพ

API แบบโฮสต์เป็นแบบไม่เซ็นเซอร์จริงๆ หรือไม่?

ใช่ API แบบโฮสต์ให้บริการโมเดลที่ปรับแต่งให้ตอบโดยไม่มีการปฏิเสธเนื้อหาสำหรับการใช้งานผู้ใหญ่ที่ถูกต้องตามกฎหมาย มันไม่ได้ใช้ตัวกรองความปลอดภัยเดียวกันกับโมเดลเชิงพาณิชย์เช่น GPT-4 อย่างไรก็ตาม มันยังคงบล็อกเนื้อหาเฉพาะเช่น เนื้อหาทางเพศที่เกี่ยวข้องกับเด็ก ซึ่งเป็นข้อกำหนดทางกฎหมายมาตรฐาน สำหรับหัวข้ออื่นๆ มันให้ความเป็นอิสระในระดับสูง

คีย์ของคุณอยู่ห่างแค่แบบฟอร์มเดียว

สร้างบัญชี คัดลอกคีย์ API เปลี่ยน Base URL นั่นคือการตั้งค่าทั้งหมด

รับคีย์ API

https://api.uncensoredllmhub.com/v1