359건 수집
2026-10-07 18:04

⚡ 오늘의 핵심

OpenTPU – AI가 직접 설계한 오픈소스 AI 가속기

AI가 개발한 오픈소스 AI 가속기: RTL, ISA, 시뮬레이터, 컴파일러, 프로파일러가 단일 저장소에 모두 포함되어 있습니다. Kintex-7 PCIe 카드에서 Qwen3, LFM2.5, Qwen3.5를 구동할 수 있습니다. - FeSens/openTPU

Hacker News

🤖 모델 & 제품 (10/26건)

News 2026-10-08

메타의 AI 전략에서 데이터 센터가 중요한 비중을 차지하는 이유

개발자이자 크리에이터인 톰 쇼(Tom Shaw)가 메타의 인프라 총괄 산토시 자나르단(Santosh Janardhan)을 만나 데이터 센터의 필요성과 메타가 데이터 센터 구축을 어떻게 선도하고 있는지 이야기를 나눴습니다. 본 포스트는 Meta Newsroom에 처음 게재되었습니다.

Meta AI Blog
OpenAI 2026-10-07

청소년의 학습과 진로 설계, AI의 미래 동참을 지원하다

학생들의 대학 입시 관리를 돕는 '컬리지 플래너(College Planner)'가 틴에이저용 ChatGPT에 도입되며, 새로운 플래시카드, 퀴즈, 틴에이저 AI 자문 위원회도 함께 선보입니다.

OpenAI Blog
OpenAI 2026-10-07

래디슨 호텔 그룹, ChatGPT에 호텔 탐색 기능 도입

래디슨 호텔 그룹이 액센츄어와 협력해 OpenAI 기술 기반의 ChatGPT 플러그인을 구축하여, 여행객들이 여행 계획 단계에서 호텔을 검색, 비교, 예약할 수 있도록 지원합니다.

OpenAI
OpenAI Blog
OpenAI 2026-10-07

모두를 위한 GPT-6와 인텔리전트 UI

인텔리전트 UI(Intelligent UI)를 탑재한 GPT-6가 ChatGPT를 통해 전 세계에 배포됩니다. 시각 자료와 직접 탐색·조작 가능한 인터랙티브 경험을 바탕으로 더욱 빠른 응답을 제공합니다.

OpenAI
OpenAI Blog
Google 2026-10-07

Playground 출시: 커스텀 게임 제작 및 플레이

Playground 개요

Google AI Blog
OpenAI 2026-10-06

점프 트레이딩이 ChatGPT로 퀀트 리서치를 확장하는 방법

점프 트레이딩(Jump Trading)이 OpenAI를 활용해 퀀트 리서치 역량을 확장하고 있습니다. 장기 실행 AI 워크플로가 다양한 데이터 소스를 인간의 검토 프로세스와 결합하는 방식을 확인해 보세요.

OpenAI트레이딩연구
OpenAI Blog
OpenAI 2026-10-06

수학 분야에서의 AI 발전 성과 공유

OpenAI가 사내 프론티어 모델을 활용해 수학 미해결 문제에 대해 도출한 새로운 연구 결과를 발표하고, Lean 기반 형식화 증명 및 연구 세부 내용을 GitHub에 공유합니다.

OpenAI연구
OpenAI Blog
OpenAI 2026-10-06

아이언클래드와 함께 컴퓨터 활용(Computer Use) 능력 고도화

OpenAI와 아이언클래드(Ironclad)가 복잡한 계약 워크플로 환경에서 AI 에이전트를 훈련 및 평가하여 전문 업무용 컴퓨터 활용 기능을 발전시키는 방식을 살펴봅니다.

OpenAI에이전트벤치마크
OpenAI Blog
Google 2026-10-06

EmbeddingGemma 2: 가볍고 공개된 멀티모달 임베딩 모델

DeepMind Blog
Anthropic 2026-10-06

사이버 검증 프로그램(Cyber Verification Program) 확대 운영

자격 요건을 갖춘 보안 전문가들이 고도화된 사이버 역량을 활용하고 차단 분류기 적용을 완화받을 수 있도록 지원하는 사이버 검증 프로그램(CVP)의 신규 확장 버전을 출시합니다.

Anthropic Blog

🌎 업계 동향 (23/146건)

Community 2026-10-07

메타와 마이크로소프트, 임직원의 Claude AI 사용 제한 조치 착수

메타(Meta)와 마이크로소프트(Microsoft)가 직원들의 Claude AI 사용을 제한하기 위한 새로운 조치를 시행하고 있습니다. 이번 결정이 업무 환경에서의 AI 활용 미래에 어떤 영향을 미칠지 살펴봅니다.

Claude
Hacker News · 264점 · 댓글 261
Community 2026-10-07

도커 에이전트 (Docker Agent)

도커(Docker) 엔지니어링 팀이 개발한 AI Agent 빌더 및 런타임 - docker/docker-agent

에이전트
Hacker News · 171점 · 댓글 81
Community 2026-10-07

AI 지원을 통한 11개 정사각형 최적 패킹 증명

11개 정사각형 패킹 최적성 증명의 Lean 공식화 - Queuingtheorydotcom/11SquaresFormalized

Hacker News · 109점 · 댓글 50
News 2026-10-07

노우스 리서치, 15억 달러 기업가치 인정 및 비즈니스용 AI 에이전트 출시

Hermes Agent의 개발사인 노우스 리서치(Nous Research)가 9,000만 달러 규모의 시리즈 B 투자를 유치했습니다.

에이전트연구
TechCrunch AI
News 2026-10-07

마이크로소프트, 엔비디아 칩 탑재 및 새로워진 윈도우 11 기반의 신형 AI PC 출시

마이크로소프트가 AI 모델과 에이전트 구동에 최적화된 엔비디아 칩셋 기반의 AI PC인 서피스 랩탑 울트라(Surface Laptop Ultra)의 사양과 가격을 공개했습니다.

에이전트가격
TechCrunch AI
News 2026-10-07

메타의 AI 에이전트 뮤즈, 모바일 출시 한 달 만에 아이패드 지원 확대

메타(Meta)가 AI 어시스턴트의 접근성과 연동성을 빠르게 확장하면서, 모바일 버전 출시 한 달 만에 아이패드용 '뮤즈(Muse)'를 선보였습니다.

에이전트
TechCrunch AI
News 2026-10-07

청소년용 챗GPT, 정신 건강 위기 상황에서도 대화 지속 유도 논란

취약한 사용자를 보호하기 위한 청소년용 안전장치에도 불구하고, 챗GPT가 위기 상황에서 대화를 계속 유도해 AI와의 부적절한 관계를 부추길 수 있다는 테스트 결과가 나왔습니다.

TechCrunch AI
News 2026-10-07

챗GPT, 신규 인터페이스 출시로 시각적 인터랙션 대폭 강화

오픈AI(OpenAI)가 챗GPT에 인터랙티브한 시각 요소를 더한 새로운 사용자 인터페이스(UI)를 출시합니다.

OpenAI
TechCrunch AI
News 2026-10-07

메타, 아동 성착취물 유도 위장 광고 탐지하는 신규 AI 툴 도입

메타가 겉보기엔 일반 광고처럼 보이지만 외부 유해 콘텐츠로 사용자를 유도하는 광고를 적발하고, 이를 차단하기 위한 새로운 AI 도구를 선보였습니다.

TechCrunch AI
News 2026-10-07

챗GPT '인텔리전트 UI' 업데이트, 사진·차트·버튼으로 답변 채운다

오픈AI가 챗GPT에 대화형 비주얼로 질문에 답할 수 있는 새로운 '인텔리전트 UI' 기능을 선보인다. GPT-6와 함께 모든 사용자에게 배포되는 이번 업데이트를 통해 챗GPT는 텍스트 응답뿐 아니라 다이어그램, 차트, 양식, 탭 가능한 버튼 등을 결합해 제공할 수 있게 된다.

OpenAI
The Verge AI
News 2026-10-07

마이크로소프트, 윈도우 및 파일 제어 권한을 코파일럿에 대폭 확대

오늘 열린 윈도우 및 서피스 행사에서 마이크로소프트는 PC 로컬 파일 접근과 OS 전반에 걸친 작업 수행이 가능해진 코파일럿(Copilot) AI 시스템 업그레이드를 공개했다. 이는 앱과 도구가 상호작용하는 '하이브리드 인텔리전스' 구상의 일환이다.

The Verge AI
News 2026-10-07

챗GPT, 대학 진학 준비 지원 도구 도입

오픈AI가 안전장치와 휴식 알림 기능을 갖춰 지난 8월 출시한 10대 전용 모드 '챗GPT 포 틴스(ChatGPT for Teens)'에 대학 입시 과정을 돕는 신규 도구를 추가한다. 오픈AI는 '칼리지 플래너(College Planner)'가 지원 요건, 마감일, 필수 과제, 장학금 신청 절차를 하나의 계획으로 통합해 정리해준다고 밝혔다.

OpenAI
The Verge AI
News 2026-10-07

메타의 에이전틱 AI '뮤즈(Muse)', 아이패드 버전 공식 출시

출시 한 달 만에 애플 앱스토어 무료 앱 1위를 차지했던 메타의 뮤즈(Muse) iOS 앱이 최신 업데이트를 통해 아이패드 네이티브 지원을 시작했다. 오픈클로, 챗GPT의 닷츠, 그록 봇 등과 경쟁하도록 설계된 메타의 에이전트 AI 도구 맥(Mac) 버전도 앞서 출시된 바 있다.

xAI에이전트규제
The Verge AI
News 2026-10-07

구글, 마크 저커버그의 ‘가상 세포’ 프로젝트에 수억 달러 투자

구글 딥마인드, 메타, AI 신약 개발 스타트업 아이소모픽 랩스가 질병 퇴치 연구에 활용될 '가상 세포(Virtual Cell)' 구축 프로젝트에 3억 달러를 공동 투자한다고 로이터가 보도했다. 이 프로젝트는 마크 저커버그와 프리실라 챈 부부가 설립한 비영리 바이오메디컬 연구 기관 바이오허브(Biohub)가 주도한다.

Google트레이딩연구
The Verge AI
News 2026-10-07

AI가 음식 배달 시장의 판도를 바꿀 수 있을까

대표적인 배달 앱 도어대시(DoorDash)는 올해 2분기에만 9억 7천만 건의 주문을 처리하고 45억 달러의 매출을 올렸다. 이에 비해 10명 규모의 프리시드 스타트업 바이츠(Bites)는 베이 에어리어에서 약 300개의 레스토랑만을 확보한 미미한 수준이지만, 이번 여름부터 본격적인 변화를 꾀하고 있다.

The Verge AI
News 2026-10-07

앤트로픽, '클로드 하이쿠 5.5' 공개… API 가격 90% 인하로 GPT-6 루나에 맞불

앤트로픽이 오늘 '클로드 하이쿠 5.5(Claude Haiku 5.5)'를 출시하며 10만 토큰 이하 요청에 대해 토큰 가격을 90% 인하했다. 문서 요약, 정보 분류, DB 질의, 상위 에이전트를 위한 소규모 작업 등 대규모 엔터프라이즈 환경에서 비용을 유발하는 반복 업무를 정조준했다.

ClaudeAnthropicOpenAI에이전트가격
VentureBeat AI
News 2026-10-07

구글 문서·스프레드시트·프레젠테이션에서 클로드(Claude) 바로 실행 가능

앤트로픽이 구글의 핵심 생산성 앱인 문서, 스프레드시트, 프레젠테이션에 클로드를 직접 통합했다. 또한 사용자들은 클로드 웹 인터페이스 내에서 이러한 파일들을 직접 열고 편집할 수 있다.

ClaudeAnthropic
VentureBeat AI
Community 2026-10-06

OpenTPU – AI가 직접 설계한 오픈소스 AI 가속기

AI가 개발한 오픈소스 AI 가속기: RTL, ISA, 시뮬레이터, 컴파일러, 프로파일러가 단일 저장소에 모두 포함되어 있습니다. Kintex-7 PCIe 카드에서 Qwen3, LFM2.5, Qwen3.5를 구동할 수 있습니다. - FeSens/openTPU

오픈소스
Hacker News · 308점 · 댓글 358
Community 2026-10-06

Claude Code의 추천 메시지 기능: 실제 고객은 사람이 아니라 모델이다

Hacker News 인기 토론 (추천수 230점, 댓글 132개)

Claude
Hacker News · 230점 · 댓글 132
Community 2026-10-06

Penguin Mail – Linux 사용자를 위한 AI 탑재 Rust 기반 오픈소스 이메일 클라이언트

Gmail, Microsoft 계정은 물론 모든 IMAP/POP3 계정을 캘린더 및 연락처와 함께 로컬 PC에서 하나의 빠르고 가벼운 앱으로 관리하세요.

오픈소스
Hacker News · 212점 · 댓글 137
News 2026-10-06

오픈AI 에이전트, 위키피디아 도구 해킹 시도 및 트래픽 폭주 유발

오픈AI의 자율 에이전트가 서드파티 웹사이트에 피해를 입히고 있다는 보고가 계속해서 이어지고 있다.

OpenAI에이전트
Ars Technica AI
News 2026-10-06

공장 자동화의 다음 단계: AI로 적응하는 기계

본 포스트는 Source에 처음 게재되었습니다.

Microsoft AI Blog
News 2026-10-05

AI 에이전트를 기업 내부 지식과 연결하기

AI 시스템이 방대한 데이터를 끊임없이 수집하고 분석함에도 불구하고, 엔터프라이즈 AI 에이전트는 종종 '지식의 부재'라는 뜻밖의 한계에 부딪힙니다. 단순한 데이터를 넘어 지식이란 개별 조직의 맥락 속에서 그 데이터가 무엇을 의미하는지 이해하는 것입니다. AI 에이전트가 상황을 추론하고 의사결정을 내리며 궁극적으로...

에이전트
MIT Tech Review AI

🛠️ 도구 & 오픈소스 (3/33건)

Tools 2026-10-08

벤 애플렉의 말에서 배우다

어릴 때부터 컴퓨터에 관심이 많았습니다. 영화가 아날로그 필름에서 디지털로 전환되던 시기부터 기술적인 면에 더욱 흥미를 갖게 되었죠. 시각 효과(VFX) 워크플로에는 이미 오랫동안 머신러닝이 포함되어 있었습니다. 그래서 저는 간단한 파이썬 스크립트 정도는 직접 작성할 줄 압니다. 오늘날 트랜스포머가 수행하는 대규모 병렬 연산의 전신 격인 합성곱 신경망(CNN)을 다루던 시절에는...

Simon Willison
Tools 2026-10-07

엣지 기기를 위한 오픈 멀티모달 d1 의사결정 모델

Hugging Face Blog
Tools 2026-10-07

소프트웨어 확장에 발맞춰 진화해야 하는 시크릿 보호

개발자들이 부주의해진 것이 아니라 개발 환경의 속도가 더 빨라진 것입니다. 개발자가 더 많은 소프트웨어를 만들 수 있게 돕는 도구라면, 보안 보호 작업도 더 많이 분담해야 합니다. 본 포스트는 GitHub Blog에 처음 게재되었습니다.

GitHub Blog AI

📚 논문 & 연구 (18/140건)

arXiv 2026-10-06

4D-HOF: 피드포워드 4D 상호작용 재구성을 위한 손-객체 플로우 매칭

기존 4D 손-객체 재구성 기법은 시퀀스별 최적화 비용이 높거나, 랜덤 노이즈로부터 상호작용을 생성하여 예측이 불안정해지는 한계가 있었습니다. 본 연구에서는 비전 파운데이션 모델이 생성한 거칠지만 유용한 추정치를 기반으로 4D 손-객체 상호작용을 재구성하는 피드포워드 프레임워크인 4D-HOF를 제안합니다. 구체적으로는 파운데이션 모델 기반의 손 정보를 이동시키는 조건부 플로우 매칭 모델을 학습합니다.

비전가격
arXiv (cs.AI)
arXiv 2026-10-06

IdeaAnchor: 문헌 연구를 통해 새로운 연구 아이디어를 도출하도록 LLM 학습시키기

과학 연구는 주로 관련 논문들을 종합 분석하여 연구 공백을 찾고 새로운 방향을 수립하는 것에서 시작됩니다. 그러나 프롬프팅이나 피드백 기반의 기존 접근법은 논문 종합에 필요한 구조화된 지도 신호가 부족하여, 문헌 기반의 아이디어 도출 능력을 언어 모델에 학습시키는 데 어려움이 있었습니다. 이에 특권 신호(privileged signals)로서 구조화된 명세를 활용해 LLM의 연구 아이디어 도출을 학습시키는 패러다임인 IdeaAnchor를 제안합니다.

연구
arXiv (cs.AI)
arXiv 2026-10-06

DepthWorld: 로봇 매니퓰레이션을 위한 3D 월드 모델

월드 모델은 정책 평가, 개선, 플래닝 전반에 걸쳐 기존 로봇 시뮬레이터를 대체할 수 있는 데이터 기반 대안을 제시합니다. 이러한 활용은 정확한 3D 기하 구조에 의존하지만, 현재 비디오 기반 월드 모델은 RGB만을 학습하여 프레임 단위로는 그럴듯해 보여도 일관된 3D 월드를 구성하지 못합니다. 이 격차를 해소하기 위해 매니퓰레이션을 위한 대규모 3D 지도 데이터와 이를 흡수할 수 있는 아키텍처라는 두 가지 핵심 진전이 필요합니다.

로봇비전규제벤치마크
arXiv (cs.AI)
arXiv 2026-10-06

Sherpa: 학생 맞춤형으로 적응형 교육을 수행하도록 LLM 가르치기

대규모 언어 모델(LLM)은 점차 유능한 문제 해결사로 진화하고 있지만, 문제를 푸는 것과 가르치는 것은 전혀 다른 영역입니다. LLM을 교수자로 훈련하는 기존 방식은 데모, 선호도 데이터, 또는 사전에 정의된 교수학적 기준에 의존해 왔습니다. 그러나 이러한 신호는 학생 개개인의 학습 결과에 기반하지 않으며, 효과적인 교육 전략은 학습자에 따라 크게 달라집니다. 본 연구는 이러한 한계를 해결하고자 합니다.

arXiv (cs.AI)
arXiv 2026-10-06

Agent in a Bottle: LLM 에이전트는 역량을 저비용의 확장 가능한 산출물로 전환할 수 있는가?

대규모 언어 모델(LLM)은 다양한 세부 작업을 해결할 수 있지만, 수백만 건의 관련 인스턴스를 개별 쿼리하는 방식은 비용 부담이 지나치게 큽니다. 그렇다면 LLM 에이전트가 이러한 워크로드를 처리할 수 있는 더 저렴한 설루션을 자율적으로 구축할 수 있을까요? 본 연구는 범용 역량을 답변 품질과 상각 비용 간 균형을 맞춘 작업 특화 설루션으로 전환하는 역량을 '보틀링(bottling)'이라 명명하고, 레이블이 지정되지 않은 전체 워크로드를 고정된 시간 내에 완료해야 하는 벤치마크인 BOTTLED를 소개합니다.

에이전트가격벤치마크
arXiv (cs.AI)
arXiv 2026-10-06

AdvSim2Real: 웹 월드 모델 내 적응형 프롬프트 인젝션에 대응하는 웹 에이전트 학습

웹 에이전트는 제3자가 작성한 페이지를 읽고 작업을 수행하므로, 페이지에 심어진 악의적 지시문이 에이전트를 본래 목표에서 벗어나게 유도할 수 있습니다. 해당 페이지에 작업에 필요한 값과 컨트롤이 포함되어 있어 에이전트가 페이지를 무작정 무시할 수도 없습니다. 현재 방어 기법은 학습 전에 고정된 인젝션 패턴으로 파인튜닝하는 방식이라, 학습된 모델에 맞춰 적응하는 공격자에 쉽게 우회됩니다. 본 연구는 적응형 공격에 견딜 수 있도록 웹 월드 모델 상에서 적대적 훈련을 수행하는 방식을 제시합니다.

에이전트
arXiv (cs.AI)
arXiv 2026-10-06

QF3: 필터링된 Q-그래디언트를 활용한 고속 플로우 강화학습

플로우 정책(Flow policy)은 시연 데이터로부터 로봇 행동을 학습하는 대표적인 정책 클래스로 자리잡았으나, 사전학습된 플로우 정책을 개선하거나 상호작용을 통해 처음부터 학습하기 위해서는 여전히 강화학습이 필수적입니다. 본 연구에서는 플로우 매칭과 비평가(critic)의 행동 그래디언트를 결합하고, 플로우 출력의 1단계 예측을 통해 역전파하는 온라인 오프-폴리시 강화학습 알고리즘인 QF3(Fast Flow RL with Filtered Q-Gradients)를 소개합니다.

로봇규제
arXiv (cs.LG)
arXiv 2026-10-06

컨포멀 예측 집합을 통한 정보 이득 정량화: 이론적 관점

컨포멀 예측(Conformal Prediction)은 유한 표본 커버리지를 보장하는 예측 집합을 출력하여 불확실성을 정량화하는 널리 쓰이는 기법입니다. 흔히 예측 집합의 크기를 불확실성의 경험적 척도로 사용하지만, 이에 대한 정보이론적 근거는 여전히 잘 알려져 있지 않습니다. 본 연구에서는 집합값 예측에 맞춰 일반화된 결정이론적 엔트로피를 활용하여 이러한 이론적 기반을 제공합니다. 특히, 일반화된 정보 척도 제품군을 도입하여...

arXiv (cs.LG)
arXiv 2026-10-06

제약 없는 공간 가변적 역확산 조건에서의 쿠라모토-시바신스키 방정식 고속 프레드홀름 안정화

공간에 따라 변하는 역확산 계수를 갖는 쿠라모토-시바신스키(Kuramoto--Sivashinsky) 방정식을 신속하게 안정화하는 최초의 피드백 제어 설계를 제안합니다. 상수 계수의 경우, Coron과 Lü (2015)의 단일 입력 프레드홀름(Fredholm) 설계는 반복되는 불안정한 고유값으로 인해 제어 가능성이 상실되는 이산 집합 값을 배제합니다. 본 연구는 두 번째 경계 입력을 도입하고 두 입력에 서로 다른 역할을 부여함으로써 이 한계를 극복합니다. 헤이만 보조정리(Heymann's Lemma)에서 착안한 핵심 아이디어

arXiv (cs.LG)
arXiv 2026-10-06

화학 반응을 위한 신경망 페트리 넷 플로우

페트리 넷(Petri nets)은 화학 반응과 같은 화학 공정을 기술하는 데 사용되어 왔으며 화학 분야와 매우 잘 부합합니다. 플레이스(Place)는 원자 간의 결합 및 각 원자의 자유 원자가, 토큰은 결합 차수 단위, 트랜지션은 결합 형성 및 분해, 보존량은 원자의 원자가 예산, 작동 규칙은 원자가 규칙에 대응됩니다. 하지만 반응에 대한 기존 학습 모델이나 페트리 넷을 메시지 전달의 구조물로만 사용하는 신경망에서는 이러한 의미론적 규칙이 보장되지 않습니다...

arXiv (cs.LG)
arXiv 2026-10-06

엄격한 슬라이딩 윈도우 제약 조건 하의 선형 밴딧

모든 연속된 행동 블록이 지정된 실행 가능 집합에 속해야 하는 엄격한 슬라이딩 윈도우 제약 조건 하에서의 선형 밴딧 문제를 연구합니다. 보상 함수가 알려진 오프라인 환경에서는 볼록성과 순환 이동 불변성 덕분에 $w\mid T$일 때 정상해(stationary solution)가 최적이며, 그렇지 않은 경우에도 $O(w)$ 갭 이내임을 증명합니다. 반면 온라인 환경에서는 기하학적 구조만으로는 학습에 불충분하며 아선형 리그릿(sublinear regret) 달성이 불가능할 수 있음을 보입니다...

arXiv (cs.LG)
arXiv 2026-10-06

로버스트 밴딧의 계산적 다항 시간 복잡도 고찰

환경이 학습자의 가설 공간에 속하지 않는 경우 일반적으로 애그노스틱 학습 보증(agnostic learning guarantees)을 적용합니다. 하지만 지도학습을 넘어서는 환경에서는 애그노스틱 보증을 얻기가 어렵습니다. 최근 밴딧 환경의 비실현 가능(unrealizable) 학습에 대한 새로운 접근 방식으로 정밀하지 않은 밴딧(imprecise bandits, 이후 robust bandits로 명칭 변경)이 제안되었으며, 넓은 클래스에 대해 $Θ(\sqrt{T})$ 리그릿을 달성하는 학습자가 제시되었습니다. 그러나 계산 복잡도 측

arXiv (cs.LG)
arXiv 2026-10-06

누락된 최소 대립쌍: LLM의 고정관념 평가 방안

거대언어모델(LLM)의 편향을 측정하는 대표적인 접근법은 대조되는 두 고정관념 문장의 로그 우도를 비교하는 것입니다. 그러나 이러한 단일 쌍 비교는 종종 신뢰하기 어렵습니다. 동일한 고정관념을 대체 속성으로 다시 표현하기만 해도 논리적으로 모순된 선호도가 나타날 수 있기 때문입니다. 이를 해결하기 위해 견고한 고정관념 평가를 위한 두 가지 비교 축을 도입하는 이중 최소 대립쌍(dual minimal pair) 설정을 제안합니다...

벤치마크
arXiv (cs.CL)
arXiv 2026-10-06

생성형 정보 검색을 위한 시맨틱 ID 공간 체계적 연구

생성형 정보 검색(GIR)은 문서 검색을 기존의 '검색 후 순위화(retrieve-and-rank)' 방식에서 모델이 문서 식별자(DocID)를 직접 예측하는 시퀀스 투 시퀀스 생성 방식으로 전환하는 혁신적인 패러다임으로 부상했습니다. DocID의 의미론적 설계가 성능에 결정적인 역할을 한다는 점은 잘 알려져 있으나, '어떤 DocID가 좋은 DocID인가?'라는 근본적 질문은 아직 충분히 규명되지 않았습니다. 기존 접근법은 연산 비용이 큰 다운스트림 평가에 크게 의존하여...

벤치마크
arXiv (cs.CL)
arXiv 2026-10-06

홀드아웃 Best-of-N: 편향 없는 평가와 그 비용

Best-of-$N$ 선정에 사용된 점수를 재사용하면 기대 보상이 과대평가될 수 있습니다. 본 연구는 $J$개의 새로운 점수를 사용하는 정책에 대해 후보당 $K$개의 독립적인 점수로 구성된 고정 행렬을 바탕으로 한 평가를 다룹니다. 후보별 점수 분포가 독립적이고 안정적인 모든 환경에서, 이 행렬에만 기반한 단일 추정량이 평가자의 기대 보상에 대해 엄밀히 비편향(unbiased)되기 위한 필요충분조건은 풀 크기 $M\ge N\ge2$에 대해 $J<K$인 경우입니다...

규제가격벤치마크
arXiv (cs.CL)
arXiv 2026-10-06

파멸적이지 않은 망각: 가짜 망각의 메커니즘 분석

언어 모델이 미세조정(finetuning) 과정에서 잊어버린 것처럼 보이는 지식도 실제로는 여전히 저장되어 있어 복구될 수 있는데, 이를 '가짜 망각(spurious forgetting)'이라 부릅니다. 새로운 사실에 대한 미세조정은 스스로 회복되는 망각 현상을 일으키기도 합니다. 이전 사실에 대한 기억이 급감했다가 새로운 사실만 계속 학습하는 과정에서 다시 회복된 후, 비로소 완전히 소실되는 식입니다. 본 연구는 이러한 망각이 왜 파멸적이지 않은지 그 메커니즘을 규명합니다...

arXiv (cs.CL)
arXiv 2026-10-06

생성형 검색에서의 패러다임, 식별자, 디코딩 분리 분석

생성형 검색(Generative Retrieval)은 언어 모델이 관련 문서의 식별자를 생성하도록 학습시킵니다. 최근 연구들은 자기회귀(autoregressive) 디코더를 디퓨전으로 대체하고 있으나, 식별자, 학습 방식, 디코딩을 동시에 변경하기 때문에 성능 차이를 패러다임 자체의 효과로 단정하기 어렵습니다. 본 논문에서는 NQ320K 및 MS300K 벤치마크를 기반으로 자기회귀, 마스크 디퓨전, 블록 디퓨전 모델을 잔차 양자화, 곱 양자화, 무작위 식별자와 결합하여 비교 분석합니다...

벤치마크
arXiv (cs.CL)
arXiv 2026-10-06

일치가 타당성을 의미하지 않는다: K-12 수학 튜터링 대화에서 학생 오류 진단에 대한 다중 LLM 합의 분석

K-12 수학 튜터링에서 학생과 튜터 간의 대화는 학습자의 문제 해결 과정과 어려움의 원인을 파악할 수 있는 풍부한 정보를 제공합니다. 최근 학습 분석학 연구는 지식 추적, 행동 모델링, 학생의 추론 오류 진단 등 다양한 다운스트림 작업을 위해 대화에서 정보를 추출하는 데 거대언어모델(LLM)을 점차 많이 활용하고 있습니다. 그러나 모델이 생성한 이러한 해석의 타당성은 여전히 충분히 검증되지 않았습니다...

연구
arXiv (cs.CL)

⚖️ 정책 & 안전 (4/6건)

Community 2026-10-05

Import AI 475: 스웜 스케일링, 구글 딥마인드의 생물학 워터마크, 그리고 AI 과학 경제

AI가 수행할 역할은 과연 누가 결정하는가?

Google
Import AI (Jack Clark)
News 2026-10-05

오픈AI, EU 지역 ChatGPT 텍스트에 워터마크 도입 예정

오픈AI가 EU AI 법(AI Act) 준수를 위해 유럽 지역에서 ChatGPT와 Codex 생성 텍스트에 워터마크를 적용합니다. 단, 텍스트 편집 시 보이지 않는 워터마크 탐지가 더 어려워질 수 있다고 밝혔습니다.

OpenAI
TechCrunch AI
Community 2026-10-01

내생적 정렬에는 의존성이 필요하다

내생적 정렬(Endogenous Alignment)에 관한 저의 글에 훌륭한 댓글들이 달렸습니다. 그중 칼 크루거(Karl Krueger)는 인간이 자녀를 가치 정렬시킬 때 강화학습보다 모방학습이 더 중요하다고 주장했습니다. 둘 중 무엇이 더 중요한지 가려내는 것은 쉽지 않지만, 모방의 중요성을 간과했다는 점에는 동의하며 다른 댓글에서 지적했듯 모방학습이 더 근본적일 수 있습니다. 군나르 자른케(Gunnar Zarncke)가 유용하게 짚어주었듯, 저는 가장 결정적인 부분을 놓치고 있었습니다...

안전
Alignment Forum
News 2026-10-01

美 법원, 구글 AI 오버뷰(AI Overviews) 대상 반독점 소송 기각

로이터 통신에 따르면, 美 연방법원이 체그(Chegg)와 펜스케 미디어(PMC)가 제기한 반독점 소송 2건을 기각했습니다. 원고 측은 구글이 AI 검색 기능으로 웹사이트 트래픽을 가로채고 있다고 주장했으나, 법원은 구글의 손을 들어주며 원고의 주장을 기각했습니다.

규제
The Verge AI

🎥 영상 & 튜토리얼 (3/8건)

YouTube 2026-10-07

생명의 암호를 풀어낸 딥마인드의 새로운 AI

❤️ Lambda 공식 웹사이트와 GPU Cloud 신청 링크를 확인해 보세요: https://lambda.ai/papers 초청해 주신 구글 딥마인드에 감사드립니다. 📝 AlphaGenome Atlas 확인하기: https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/ https://blog.google/innovation-and-ai/models-and-research/g

Google연구
Two Minute Papers
YouTube 2026-10-07

63억 달러 가치의 오픈 가중치 모델, 프랑스 팀에 굴욕을 맛보다...

KERNEL은 AI 에이전트가 어떤 웹사이트에서든 작업할 수 있도록 지원하는 가장 간편한 솔루션입니다. 코드 FIRESHIP을 입력하면 30달러 상당의 Hobbyist 티어로 무료 업그레이드할 수 있습니다: https://kernel.sh/fireship 이번 주 미스트랄(Mistral), 리플렉션 AI(Reflection AI), 문샷(Moonshot) 모두 오픈 가중치 경쟁에서 굵직한 행보를 보였습니다. 자세한 내용을 살펴보겠습니다. Fireship 콘텐츠 더 보기: 🗞️ 뉴스레터: https://bytes.dev 🧠 강의: h

Mistral에이전트
Fireship
YouTube 2026-10-02

AI 뉴스: Dots, GPT-6.1 Sol, Sonnet 5.5, Gemini 4 및 최신 핵심 소식 총정리

이번 주 놓쳤을 법한 주요 AI 소식을 전해드립니다. Optimizely의 Virtual Teammates가 무엇을 자동화해 줄 수 있는지 확인해 보세요: https://optimizely.com/mattwolfe 추가 정보: 🛠️ AI 툴 및 뉴스 탐색: https://futuretools.io/ 📰 주간 뉴스레터: https://futuretools.io/newsletter 소셜 채널: ❌ X(트위터): https://x.com/mreflow 🖼️ 인스타그램: https://instagram.com/mr.eflow 🧵 스레드:

OpenAIGoogle
Matt Wolfe AI